探索/大模型

经典大模型arXiv:2203.02155

InstructGPT:让模型听人话

Training language models to follow instructions with human feedback

Long Ouyang, Jeff Wu, Xu Jiang, Diogo Almeida, Carroll L. Wainwright, Pamela Mishkin, Chong Zhang, Sandhini Agarwal, Katarina Slama, Alex Ray, John Schulman, Jacob Hilton, Fraser Kelton, Luke Miller, Maddie Simens, Amanda Askell, Peter Welinder, Paul Christiano, Jan Leike, Ryan Lowe

NeurIPS · 2022

12k 引用 · 1.6k 阅读 · 0 收藏

摘要

用指令监督和人类反馈强化学习微调 GPT-3,使人更偏好其回答,也更符合用户意图。

Fine-tunes GPT-3 with supervised instruction data and RLHF so that the model better follows user intent and is preferred by human evaluators.

提要

InstructGPT 把擅长续写的 GPT-3 变成更会按指令做事的模型,使对齐成为主路径而非附录。它通过指令监督与人类反馈强化学习,让输出更符合用户意图,并在人类评价中更受偏好。

01背景与动机

大型语言模型在海量文本上做下一词预测,擅长流畅续写,但并不天然会按用户指令完成任务。它们可能忽视约束、答非所问,或给出看似合理却偏离真实意图的回答。面向实际使用时,仅靠预训练难以保证“听人话”,对齐不应再被当作可有可无的附录。

本文动机在于证明:经指令数据与人类反馈对齐后,一个小得多的模型在人类评价上可以胜过原始 GPT-3。意图匹配与偏好优化能直接提升有用性,使对齐成为改进产品体验的主路径,而不是规模竞赛的补充说明。

02核心方法

方法分为三步。第一步用人类撰写的指令与示范回答做监督微调(SFT),让模型学会基本的指令遵循。第二步收集同一提示下不同输出的人类两两偏好,训练奖励模型拟合这些比较。第三步以奖励模型为信号,用 PPO 对策略做强化学习(RLHF),在保持接近 SFT 策略的同时提高人类偏好得分。

方法三步骤示意:(1)监督微调(SFT);(2)奖励模型(RM)训练;(3)基于该奖励模型用近端策略优化(PPO)强化学习。蓝箭头表示该数据用于训练模型。步骤2中框A–D为标注者排序的模型样本。详见第3节。
1. 方法三步骤示意:(1)监督微调(SFT);(2)奖励模型(RM)训练;(3)基于该奖励模型用近端策略优化(PPO)强化学习。蓝箭头表示该数据用于训练模型。步骤2中框A–D为标注者排序的模型样本。详见第3节。

03结果与证据

人类评估者更偏好 InstructGPT 的回答,认为其更有帮助、也更符合用户意图。工作表明,经过对齐的较小模型可以在人类评价上优于未做指令对齐的原始 GPT-3。证据重心在偏好与意图遵循,而不是宣称所有自动基准都同步全面领先。

(a)
2. (a)

04影响与意义

这套“SFT—奖励模型—PPO”流程此后成为对话式大模型的工业标配,偏好数据也从边缘标注变成核心训练资产。意图对齐被放在比单纯刷基准更接近产品价值的位置,人类偏好被当作可学习的奖励信号,并被后续系统广泛迁移。

(b)
3. (b)

05局限

RLHF 训练不稳定且成本高,模型容易过拟合特定标注员的口味与表述习惯。表面上的礼貌、合规话术仍可能掩盖真实有害行为。流程本身可以迁移,但不能假设某一批标注者的偏好具有普遍代表性。

06要点

  1. 01意图对齐比单纯刷基准更接近产品价值。
  2. 02人类偏好是一种可学习的奖励信号。
  3. 03对齐流程可以迁移,但标注口味不能假设普适。

为何入典

ChatGPT 能成为产品,靠的不是更大的 GPT-3,而是这篇对齐流程。

标签

RLHFalignment

相关论文

和这篇论文对话

开启对话后,本页的标题、摘要、导读和图注会装进上下文。模型是你自己接入的。

登录后可以接入自己的模型,向这篇论文提问。