经典大模型arXiv:2203.02155
InstructGPT:让模型听人话
Training language models to follow instructions with human feedback
Long Ouyang, Jeff Wu, Xu Jiang, Diogo Almeida, Carroll L. Wainwright, Pamela Mishkin, Chong Zhang, Sandhini Agarwal, Katarina Slama, Alex Ray, John Schulman, Jacob Hilton, Fraser Kelton, Luke Miller, Maddie Simens, Amanda Askell, Peter Welinder, Paul Christiano, Jan Leike, Ryan Lowe
NeurIPS · 2022
12k 引用 · 1.6k 阅读 · 0 收藏
摘要
用指令监督和人类反馈强化学习微调 GPT-3,使人更偏好其回答,也更符合用户意图。
Fine-tunes GPT-3 with supervised instruction data and RLHF so that the model better follows user intent and is preferred by human evaluators.
提要
InstructGPT 把擅长续写的 GPT-3 变成更会按指令做事的模型,使对齐成为主路径而非附录。它通过指令监督与人类反馈强化学习,让输出更符合用户意图,并在人类评价中更受偏好。
01背景与动机
大型语言模型在海量文本上做下一词预测,擅长流畅续写,但并不天然会按用户指令完成任务。它们可能忽视约束、答非所问,或给出看似合理却偏离真实意图的回答。面向实际使用时,仅靠预训练难以保证“听人话”,对齐不应再被当作可有可无的附录。
本文动机在于证明:经指令数据与人类反馈对齐后,一个小得多的模型在人类评价上可以胜过原始 GPT-3。意图匹配与偏好优化能直接提升有用性,使对齐成为改进产品体验的主路径,而不是规模竞赛的补充说明。
02核心方法
方法分为三步。第一步用人类撰写的指令与示范回答做监督微调(SFT),让模型学会基本的指令遵循。第二步收集同一提示下不同输出的人类两两偏好,训练奖励模型拟合这些比较。第三步以奖励模型为信号,用 PPO 对策略做强化学习(RLHF),在保持接近 SFT 策略的同时提高人类偏好得分。

03结果与证据
人类评估者更偏好 InstructGPT 的回答,认为其更有帮助、也更符合用户意图。工作表明,经过对齐的较小模型可以在人类评价上优于未做指令对齐的原始 GPT-3。证据重心在偏好与意图遵循,而不是宣称所有自动基准都同步全面领先。

04影响与意义
这套“SFT—奖励模型—PPO”流程此后成为对话式大模型的工业标配,偏好数据也从边缘标注变成核心训练资产。意图对齐被放在比单纯刷基准更接近产品价值的位置,人类偏好被当作可学习的奖励信号,并被后续系统广泛迁移。

05局限
RLHF 训练不稳定且成本高,模型容易过拟合特定标注员的口味与表述习惯。表面上的礼貌、合规话术仍可能掩盖真实有害行为。流程本身可以迁移,但不能假设某一批标注者的偏好具有普遍代表性。
06要点
- 01意图对齐比单纯刷基准更接近产品价值。
- 02人类偏好是一种可学习的奖励信号。
- 03对齐流程可以迁移,但标注口味不能假设普适。
为何入典
ChatGPT 能成为产品,靠的不是更大的 GPT-3,而是这篇对齐流程。
标签
相关论文
DPO:不用强化学习的偏好对齐
Direct Preference Optimization: Your Language Model is Secretly a Reward Model
DeepSeek-R1:用强化学习把推理训出来
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
GPT-3:上下文里的少样本学习
Language Models are Few-Shot Learners
和这篇论文对话
开启对话后,本页的标题、摘要、导读和图注会装进上下文。模型是你自己接入的。