自监督学习:大模型时代的隐形主角

自监督学习从数据本身构造监督信号——把句子挖空让模型填、把图片遮住让模型补。不需要人工标注,却能从海量数据中学到丰富知识,这是大模型能被训出来的关键。

自监督学习的精妙在于“把找答案的任务藏进了数据本身”。一句话盖住一个词,模型要靠上下文猜出来——这个过程同时教会了它语法、常识和世界知识。人类婴儿大概也是这样,在不断的“预测与验证”中理解世界的。

## 核心要点


图片[1]-自监督学习:大模型时代的隐形主角-子比笔记

图片来源:Openverse / ajmexico(https://www.flickr.com/photos/15587432@N02/3281139507)

1. 掩码语言建模(BERT 式)与下一词预测(GPT 式)是两大范式。

2. 自监督让互联网规模的文本都变成了可用的训练数据。

3. 它学到的是语言的统计结构,事实知识仍需外部补充。

4. 从图像到视频到语音,自监督正在向各模态扩展。

图片[2]-自监督学习:大模型时代的隐形主角-子比笔记

图片来源:Openverse / Nicodemus♐(https://www.flickr.com/photos/47340454@N06/40864257384)

## 写在最后

以上是关于「自监督学习」的科普介绍。人工智能正在快速发展,相关概念和方法也在不断演进。希望本文能帮你建立对这一主题的基本认识。

© 版权声明
THE END
喜欢就支持一下吧
点赞6 分享
评论 抢沙发
头像
欢迎您留下宝贵的见解!
提交
头像

昵称

取消
昵称表情代码图片快捷回复

    请登录后查看评论内容