InstructGPT:让模型学会“听话”

InstructGPT(GPT-3.5 的前身)解决了原始大模型“不听话”的问题:它不懂指令、答非所问。通过人类反馈强化学习(RLHF),模型学会了理解并遵循人类意图。

InstructGPT 的故事说明:能力强大不等于有用。一个才华横溢但完全不解风情的天才,用户体验可能很差。技术的产品化,往往不只是把能力做上去,还要把能力调整到人们真正需要的样子。

## 核心要点


图片[1]-InstructGPT:让模型学会“听话”-子比笔记

图片来源:Openverse / dalecruse(https://www.flickr.com/photos/91873384@N04/54307709351)

1. RLHF 三步走:采样、排序、训练奖励模型。

2. 对齐让模型从“能说话”变成“会办事”。

3. 对齐过程也会引入偏见——标注者的价值观被写进模型。

4. ChatGPT 的成功一半是模型能力,一半是对齐技术。

图片[2]-InstructGPT:让模型学会“听话”-子比笔记

图片来源:Openverse / Ars Electronica(https://www.flickr.com/photos/36085842@N06/4957124417)

## 写在最后

以上是关于「InstructGPT」的科普介绍。人工智能正在快速发展,相关概念和方法也在不断演进。希望本文能帮你建立对这一主题的基本认识。

© 版权声明
THE END
喜欢就支持一下吧
点赞13 分享
评论 抢沙发
头像
欢迎您留下宝贵的见解!
提交
头像

昵称

取消
昵称表情代码图片快捷回复

    请登录后查看评论内容