自监督学习从数据本身构造监督信号——把句子挖空让模型填、把图片遮住让模型补。不需要人工标注,却能从海量数据中学到丰富知识,这是大模型能被训出来的关键。
自监督学习的精妙在于“把找答案的任务藏进了数据本身”。一句话盖住一个词,模型要靠上下文猜出来——这个过程同时教会了它语法、常识和世界知识。人类婴儿大概也是这样,在不断的“预测与验证”中理解世界的。
## 核心要点
![图片[1]-自监督学习:大模型时代的隐形主角-子比笔记](https://zibi.1ddc.com/wp-content/uploads/2026/09/ai-pool-6-6-3281139507_f56091fa84_b.jpg)
图片来源:Openverse / ajmexico(https://www.flickr.com/photos/15587432@N02/3281139507)
1. 掩码语言建模(BERT 式)与下一词预测(GPT 式)是两大范式。
2. 自监督让互联网规模的文本都变成了可用的训练数据。
3. 它学到的是语言的统计结构,事实知识仍需外部补充。
4. 从图像到视频到语音,自监督正在向各模态扩展。
![图片[2]-自监督学习:大模型时代的隐形主角-子比笔记](https://zibi.1ddc.com/wp-content/uploads/2026/09/ai-pool-20-6-40864257384_502e2176b3_b.jpg)
图片来源:Openverse / Nicodemus♐(https://www.flickr.com/photos/47340454@N06/40864257384)
## 写在最后
以上是关于「自监督学习」的科普介绍。人工智能正在快速发展,相关概念和方法也在不断演进。希望本文能帮你建立对这一主题的基本认识。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
THE END















请登录后查看评论内容