模型版本与迭代:如何选择适合的模型
大模型版本迭代极快,几乎每月都有新版本。选型不是选最强的,而是选最适合的:在能力、成本、延迟、合规之间找到匹配业务需求的那一个。 模型选型的智慧其实是“克制”:不被最强参数诱惑,诚...
预训练:大模型如何“读完整个互联网”
预训练是大模型获得通用能力的阶段:在数万亿 token 的文本上做“下一词预测”训练。这个看似简单的任务,逼迫模型学到了语法、常识、逻辑、世界知识。 下一词预测这个任务设计之精妙,在于它无...
预训练数据:模型的“食谱”决定上限
预训练数据的质量直接决定模型上限。Common Crawl、维基百科、论文库、代码库是主要来源,清洗、去重、去毒、配比每一步都是技术活。模型的表现,其实在数据准备阶段就已注定大半。 预训练数据...
GPT 的发展史:从 GPT-1 到 GPT-4
GPT 系列从 2018 年的 GPT-1(1.17 亿参数)到 GPT-4,参数规模涨了上千倍,能力从“勉强通顺”进化到“通过律师考试”。它的发展史就是大模型时代的缩影。 GPT 的历史最值得记住的一课是:Open...
GPT-4:第一个像专家的 AI
GPT-4 在律考中进入前 10%,在生物奥赛达到金牌水平,能看图、能写代码、能推理复杂逻辑。它是第一个让人类专家感到“被逼近”的 AI,也把“AGI 临近”的讨论推上风口浪尖。 GPT-4 让人印象最深...
Claude:以安全著称的挑战者
Claude 由 OpenAI 前员工创立的 Anthropic 开发,以长上下文、强写作能力和对安全的极致追求著称。它是 GPT 最强有力的竞争者,在很多维度上已不输甚至更优。 Anthropic 的存在本身就有价值:当...
MoE:混合专家模型的工作原理
MoE(Mixture of Experts)把模型拆成多个“专家”子网络,每次推理只激活其中少数几个。这样既保持了总参数带来的能力,又大幅降低了实际计算量。 MoE 的思想非常人性化:就像医院分科,病人来...
自监督学习:大模型时代的隐形主角
自监督学习从数据本身构造监督信号——把句子挖空让模型填、把图片遮住让模型补。不需要人工标注,却能从海量数据中学到丰富知识,这是大模型能被训出来的关键。 自监督学习的精妙在于“把找答...
涌现能力:量变何时引发质变
涌现能力指模型规模突破某个阈值后,突然表现出训练时未直接强化的新能力——比如学会做数学题、写代码、理解幽默。这种“整体大于部分之和”的现象是当前 AI 研究的热点。 对应用者而言,关注...
缩放定律:AI 领域最重要的经验规律
缩放定律(Scaling Law)揭示:模型性能随着参数量、数据量、算力的增加而可预测地提升,且在对数坐标下近似线性。这条定律是近十年 AI 算力军备竞赛的理论依据。 缩放定律最深远的影响是改变了...











