InstructGPT:让模型学会“听话”
InstructGPT(GPT-3.5 的前身)解决了原始大模型“不听话”的问题:它不懂指令、答非所问。通过人类反馈强化学习(RLHF),模型学会了理解并遵循人类意图。 InstructGPT 的故事说明:能力强大不...
AI 对齐:让机器的价值观与人类一致
对齐(Alignment)是确保 AI 系统的目标、行为与人类价值观一致的技术努力。一个能力强但目标错误的 AI 会造成巨大危害——这正是对齐问题被提升到战略高度的原因。 对齐问题之所以困难,是因为...



