半监督学习:用少量标签撬动大数据

半监督学习介于监督与无监督之间:用少量有标签数据加大量无标签数据一起训练。它针对的是标注成本高、但原始数据充足的现实困境。

半监督学习体现了一种很实用的工程哲学:不追求完美条件,而是用现有资源做到最好。现实中几乎没有项目能拿到理想中的标注数据,如何在“数据不完美”的前提下做出可用的模型,才是真正的核心竞争力。

## 核心要点


图片[1]-半监督学习:用少量标签撬动大数据-子比笔记

图片来源:Openverse / Andrew Mason(https://www.flickr.com/photos/34754790@N00/13998109)

1. 核心假设是相似的数据点往往有相似标签。

2. 自训练、协同训练是常见策略:用模型给无标签数据打伪标签。

3. 在工业缺陷检测等标注昂贵的场景很有价值。

4. 效果通常明显优于纯无监督,接近全监督但成本低得多。

图片[2]-半监督学习:用少量标签撬动大数据-子比笔记

图片来源:Openverse / morrisonbrett(https://www.flickr.com/photos/22183514@N00/19799056499)

## 写在最后

以上是关于「半监督学习」的科普介绍。人工智能正在快速发展,相关概念和方法也在不断演进。希望本文能帮你建立对这一主题的基本认识。

© 版权声明
THE END
喜欢就支持一下吧
点赞6 分享
评论 抢沙发
头像
欢迎您留下宝贵的见解!
提交
头像

昵称

取消
昵称表情代码图片快捷回复

    请登录后查看评论内容