预训练是大模型获得通用能力的阶段:在数万亿 token 的文本上做“下一词预测”训练。这个看似简单的任务,逼迫模型学到了语法、常识、逻辑、世界知识。
下一词预测这个任务设计之精妙,在于它无需任何人工标注:互联网上所有文本天然都是训练数据。把一个极度简单的任务配上极大规模的数据,竟然涌现出了智能——这种“大力出奇迹”的哲学,是这个时代最浪漫的技术故事。
## 核心要点
![图片[1]-预训练:大模型如何“读完整个互联网”-子比笔记](https://zibi.1ddc.com/wp-content/uploads/2026/09/ai-pool-19-0-24797243879_8d500595ac_b.jpg)
图片来源:Openverse / fabola(https://www.flickr.com/photos/44124339301@N01/24797243879)
1. 预训练是大模型成本最高的阶段,动辄数百万到上亿美元。
2. 数据清洗去重是预训练中最被低估的技术环节。
3. Chinchilla 定律给出数据量与参数量的最优配比。
4. 预训练决定模型的“天赋”,微调决定“后天培养”。
![图片[2]-预训练:大模型如何“读完整个互联网”-子比笔记](https://zibi.1ddc.com/wp-content/uploads/2026/09/ai-pool-20-11-44570014821_0bd7e1ffd3_b.jpg)
图片来源:Openverse / Ars Electronica(https://www.flickr.com/photos/36085842@N06/44570014821)
## 写在最后
以上是关于「预训练」的科普介绍。人工智能正在快速发展,相关概念和方法也在不断演进。希望本文能帮你建立对这一主题的基本认识。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
THE END













请登录后查看评论内容