大语言模型 第4页
语言模型的概率:它真在“想”吗-子比笔记

语言模型的概率:它真在“想”吗

语言模型的本质是:给定上文,输出下一个 token 的概率分布。它不“思考”,只是基于训练数据中的统计规律做高概率的续写。理解这一点,是理解它所有优点与缺点的钥匙。 接受“AI 是概率机器”...
admin的头像-子比笔记admin11小时前
03810
上下文学习:不用微调也能学会新任务-子比笔记

上下文学习:不用微调也能学会新任务

上下文学习(ICL)是大模型最神奇的能力:在提示词里给几个示例,模型就能照着做,不需要任何训练。这种“看一眼就会”的能力,是大模型通用性的直接体现。 上下文学习的美妙在于零成本的知识传...
思维链:让 AI 学会“想清楚再回答”-子比笔记

思维链:让 AI 学会“想清楚再回答”

思维链(Chain-of-Thought)让模型把推理过程写出来再给答案,而不是直接输出结论。“请一步一步思考”这句简单提示,就能显著提升模型的数学与逻辑能力。 思维链的原理其实很人性化:人做复杂...
admin的头像-子比笔记admin11小时前
0359
Claude:以安全著称的挑战者-子比笔记

Claude:以安全著称的挑战者

Claude 由 OpenAI 前员工创立的 Anthropic 开发,以长上下文、强写作能力和对安全的极致追求著称。它是 GPT 最强有力的竞争者,在很多维度上已不输甚至更优。 Anthropic 的存在本身就有价值:当...
什么是大语言模型:它到底大在哪里-子比笔记

什么是大语言模型:它到底大在哪里

大语言模型(LLM)是参数规模达到数十亿到数千亿的语言模型,通过在互联网级文本上预训练,获得了对话、写作、编程、推理等广泛能力。它“大”在参数、数据、算力,也“大”在能力范围。 理解大...
GPT 的发展史:从 GPT-1 到 GPT-4-子比笔记

GPT 的发展史:从 GPT-1 到 GPT-4

GPT 系列从 2018 年的 GPT-1(1.17 亿参数)到 GPT-4,参数规模涨了上千倍,能力从“勉强通顺”进化到“通过律师考试”。它的发展史就是大模型时代的缩影。 GPT 的历史最值得记住的一课是:Open...
admin的头像-子比笔记admin11小时前
04511
BERT:理解语言的一代宗师-子比笔记

BERT:理解语言的一代宗师

BERT 是 Google 2018 年推出的双向语言模型,通过掩码预训练让模型深度理解文本语义。它统治了自然语言理解任务三年,是 Transformer 编码器路线的巅峰之作。 BERT 与 GPT 代表了两种哲学:BERT...
admin的头像-子比笔记admin11小时前
02412
InstructGPT:让模型学会“听话”-子比笔记

InstructGPT:让模型学会“听话”

InstructGPT(GPT-3.5 的前身)解决了原始大模型“不听话”的问题:它不懂指令、答非所问。通过人类反馈强化学习(RLHF),模型学会了理解并遵循人类意图。 InstructGPT 的故事说明:能力强大不...
admin的头像-子比笔记admin11小时前
03013
ChatGPT:改变世界的一个对话框-子比笔记

ChatGPT:改变世界的一个对话框

2022 年 11 月 30 日,ChatGPT 上线。这个极简的对话框在两个月内获得一亿用户,成为史上增长最快的产品,也彻底点燃了全球的 AI 狂热。 ChatGPT 最深刻的产品启示是:把技术的复杂性完全藏起来...
admin的头像-子比笔记admin11小时前
02813
GPT-4:第一个像专家的 AI-子比笔记

GPT-4:第一个像专家的 AI

GPT-4 在律考中进入前 10%,在生物奥赛达到金牌水平,能看图、能写代码、能推理复杂逻辑。它是第一个让人类专家感到“被逼近”的 AI,也把“AGI 临近”的讨论推上风口浪尖。 GPT-4 让人印象最深...
admin的头像-子比笔记admin11小时前
04111