大模型 第2页
模型版本与迭代:如何选择适合的模型-子比笔记

模型版本与迭代:如何选择适合的模型

大模型版本迭代极快,几乎每月都有新版本。选型不是选最强的,而是选最适合的:在能力、成本、延迟、合规之间找到匹配业务需求的那一个。 模型选型的智慧其实是“克制”:不被最强参数诱惑,诚...
admin的头像-子比笔记admin10小时前
0348
预训练:大模型如何“读完整个互联网”-子比笔记

预训练:大模型如何“读完整个互联网”

预训练是大模型获得通用能力的阶段:在数万亿 token 的文本上做“下一词预测”训练。这个看似简单的任务,逼迫模型学到了语法、常识、逻辑、世界知识。 下一词预测这个任务设计之精妙,在于它无...
admin的头像-子比笔记admin10小时前
02613
预训练数据:模型的“食谱”决定上限-子比笔记

预训练数据:模型的“食谱”决定上限

预训练数据的质量直接决定模型上限。Common Crawl、维基百科、论文库、代码库是主要来源,清洗、去重、去毒、配比每一步都是技术活。模型的表现,其实在数据准备阶段就已注定大半。 预训练数据...
admin的头像-子比笔记admin10小时前
02710
GPT 的发展史:从 GPT-1 到 GPT-4-子比笔记

GPT 的发展史:从 GPT-1 到 GPT-4

GPT 系列从 2018 年的 GPT-1(1.17 亿参数)到 GPT-4,参数规模涨了上千倍,能力从“勉强通顺”进化到“通过律师考试”。它的发展史就是大模型时代的缩影。 GPT 的历史最值得记住的一课是:Open...
admin的头像-子比笔记admin10小时前
04511
GPT-4:第一个像专家的 AI-子比笔记

GPT-4:第一个像专家的 AI

GPT-4 在律考中进入前 10%,在生物奥赛达到金牌水平,能看图、能写代码、能推理复杂逻辑。它是第一个让人类专家感到“被逼近”的 AI,也把“AGI 临近”的讨论推上风口浪尖。 GPT-4 让人印象最深...
admin的头像-子比笔记admin10小时前
04111
Claude:以安全著称的挑战者-子比笔记

Claude:以安全著称的挑战者

Claude 由 OpenAI 前员工创立的 Anthropic 开发,以长上下文、强写作能力和对安全的极致追求著称。它是 GPT 最强有力的竞争者,在很多维度上已不输甚至更优。 Anthropic 的存在本身就有价值:当...
admin的头像-子比笔记admin10小时前
03814
MoE:混合专家模型的工作原理-子比笔记

MoE:混合专家模型的工作原理

MoE(Mixture of Experts)把模型拆成多个“专家”子网络,每次推理只激活其中少数几个。这样既保持了总参数带来的能力,又大幅降低了实际计算量。 MoE 的思想非常人性化:就像医院分科,病人来...
admin的头像-子比笔记admin10小时前
0478
自监督学习:大模型时代的隐形主角-子比笔记

自监督学习:大模型时代的隐形主角

自监督学习从数据本身构造监督信号——把句子挖空让模型填、把图片遮住让模型补。不需要人工标注,却能从海量数据中学到丰富知识,这是大模型能被训出来的关键。 自监督学习的精妙在于“把找答...
admin的头像-子比笔记admin10小时前
0256
涌现能力:量变何时引发质变-子比笔记

涌现能力:量变何时引发质变

涌现能力指模型规模突破某个阈值后,突然表现出训练时未直接强化的新能力——比如学会做数学题、写代码、理解幽默。这种“整体大于部分之和”的现象是当前 AI 研究的热点。 对应用者而言,关注...
admin的头像-子比笔记admin10小时前
0468
缩放定律:AI 领域最重要的经验规律-子比笔记

缩放定律:AI 领域最重要的经验规律

缩放定律(Scaling Law)揭示:模型性能随着参数量、数据量、算力的增加而可预测地提升,且在对数坐标下近似线性。这条定律是近十年 AI 算力军备竞赛的理论依据。 缩放定律最深远的影响是改变了...
admin的头像-子比笔记admin10小时前
04111