语言模型的概率:它真在“想”吗
语言模型的本质是:给定上文,输出下一个 token 的概率分布。它不“思考”,只是基于训练数据中的统计规律做高概率的续写。理解这一点,是理解它所有优点与缺点的钥匙。 接受“AI 是概率机器”...
上下文学习:不用微调也能学会新任务
上下文学习(ICL)是大模型最神奇的能力:在提示词里给几个示例,模型就能照着做,不需要任何训练。这种“看一眼就会”的能力,是大模型通用性的直接体现。 上下文学习的美妙在于零成本的知识传...
思维链:让 AI 学会“想清楚再回答”
思维链(Chain-of-Thought)让模型把推理过程写出来再给答案,而不是直接输出结论。“请一步一步思考”这句简单提示,就能显著提升模型的数学与逻辑能力。 思维链的原理其实很人性化:人做复杂...
Claude:以安全著称的挑战者
Claude 由 OpenAI 前员工创立的 Anthropic 开发,以长上下文、强写作能力和对安全的极致追求著称。它是 GPT 最强有力的竞争者,在很多维度上已不输甚至更优。 Anthropic 的存在本身就有价值:当...
什么是大语言模型:它到底大在哪里
大语言模型(LLM)是参数规模达到数十亿到数千亿的语言模型,通过在互联网级文本上预训练,获得了对话、写作、编程、推理等广泛能力。它“大”在参数、数据、算力,也“大”在能力范围。 理解大...
GPT 的发展史:从 GPT-1 到 GPT-4
GPT 系列从 2018 年的 GPT-1(1.17 亿参数)到 GPT-4,参数规模涨了上千倍,能力从“勉强通顺”进化到“通过律师考试”。它的发展史就是大模型时代的缩影。 GPT 的历史最值得记住的一课是:Open...
BERT:理解语言的一代宗师
BERT 是 Google 2018 年推出的双向语言模型,通过掩码预训练让模型深度理解文本语义。它统治了自然语言理解任务三年,是 Transformer 编码器路线的巅峰之作。 BERT 与 GPT 代表了两种哲学:BERT...
InstructGPT:让模型学会“听话”
InstructGPT(GPT-3.5 的前身)解决了原始大模型“不听话”的问题:它不懂指令、答非所问。通过人类反馈强化学习(RLHF),模型学会了理解并遵循人类意图。 InstructGPT 的故事说明:能力强大不...
ChatGPT:改变世界的一个对话框
2022 年 11 月 30 日,ChatGPT 上线。这个极简的对话框在两个月内获得一亿用户,成为史上增长最快的产品,也彻底点燃了全球的 AI 狂热。 ChatGPT 最深刻的产品启示是:把技术的复杂性完全藏起来...
GPT-4:第一个像专家的 AI
GPT-4 在律考中进入前 10%,在生物奥赛达到金牌水平,能看图、能写代码、能推理复杂逻辑。它是第一个让人类专家感到“被逼近”的 AI,也把“AGI 临近”的讨论推上风口浪尖。 GPT-4 让人印象最深...











