预训练:大模型如何“读完整个互联网”
预训练是大模型获得通用能力的阶段:在数万亿 token 的文本上做“下一词预测”训练。这个看似简单的任务,逼迫模型学到了语法、常识、逻辑、世界知识。 下一词预测这个任务设计之精妙,在于它无...
迁移学习:站在巨人的肩膀上
迁移学习把在一个任务上学到的知识迁移到另一个相关任务上——先用大数据训好通用模型,再用少量领域数据微调。它让小团队也能用上顶级 AI 能力。 迁移学习最动人的地方在于“知识可复用”这件...
自监督学习:大模型时代的隐形主角
自监督学习从数据本身构造监督信号——把句子挖空让模型填、把图片遮住让模型补。不需要人工标注,却能从海量数据中学到丰富知识,这是大模型能被训出来的关键。 自监督学习的精妙在于“把找答...




