预训练:大模型如何“读完整个互联网”

预训练是大模型获得通用能力的阶段:在数万亿 token 的文本上做“下一词预测”训练。这个看似简单的任务,逼迫模型学到了语法、常识、逻辑、世界知识。

下一词预测这个任务设计之精妙,在于它无需任何人工标注:互联网上所有文本天然都是训练数据。把一个极度简单的任务配上极大规模的数据,竟然涌现出了智能——这种“大力出奇迹”的哲学,是这个时代最浪漫的技术故事。

## 核心要点


图片[1]-预训练:大模型如何“读完整个互联网”-子比笔记

图片来源:Openverse / fabola(https://www.flickr.com/photos/44124339301@N01/24797243879)

1. 预训练是大模型成本最高的阶段,动辄数百万到上亿美元。

2. 数据清洗去重是预训练中最被低估的技术环节。

3. Chinchilla 定律给出数据量与参数量的最优配比。

4. 预训练决定模型的“天赋”,微调决定“后天培养”。

图片[2]-预训练:大模型如何“读完整个互联网”-子比笔记

图片来源:Openverse / Ars Electronica(https://www.flickr.com/photos/36085842@N06/44570014821)

## 写在最后

以上是关于「预训练」的科普介绍。人工智能正在快速发展,相关概念和方法也在不断演进。希望本文能帮你建立对这一主题的基本认识。

© 版权声明
THE END
喜欢就支持一下吧
点赞13 分享
评论 抢沙发
头像
欢迎您留下宝贵的见解!
提交
头像

昵称

取消
昵称表情代码图片快捷回复

    请登录后查看评论内容