探索/大模型

经典大模型arXiv:2305.18290

DPO:不用强化学习的偏好对齐

Direct Preference Optimization: Your Language Model is Secretly a Reward Model

Rafael Rafailov, Archit Sharma, Eric Mitchell, Stefano Ermon, Christopher D. Manning, Chelsea Finn

NeurIPS · 2023

6.0k 引用 · 1.6k 阅读 · 0 收藏

摘要

从 RLHF 目标推出最优策略的闭式形式,从而用分类损失直接对齐偏好,不再需要单独的奖励模型和 PPO。

Derives a closed-form extraction of the optimal RLHF policy, allowing preference alignment via a simple classification loss without a separate reward model or PPO.

提要

DPO 从标准 RLHF 目标推出最优策略的闭式形式,使偏好对齐可写成对所选与拒绝回复的分类损失。它表明不必单独训练奖励模型或运行 PPO,最优策略已隐含在奖励与参考策略的数学关系中。

01背景与动机

传统 RLHF 通常先拟合奖励模型,再用 PPO 等策略梯度方法在奖励与相对参考策略的 KL 约束下优化语言模型。该流程涉及多阶段训练、采样与超参调节,实现成本高且训练过程往往不稳定,限制了开源社区的复现与迭代速度。

DPO 将人类偏好对齐改写为对所选回复与拒绝回复的对比学习问题。其动机是:若最优策略与奖励之间存在可逆的解析关系,则可以直接在策略参数上优化偏好似然,从而绕开显式奖励拟合与在线强化学习循环。

02核心方法

从带 KL 正则的 RL 目标出发,可得到最优策略关于奖励的闭式表达;再反解出奖励,并代入 Bradley-Terry 等偏好模型,得到仅含策略与参考策略的偏好概率。训练时固定参考策略作正则,用分类损失提高优选回复相对拒绝回复的隐式奖励差。

具体地,损失函数比较同一提示下两个回复在当前策略与参考策略上的对数概率比,使模型更倾向人类标注为更好的输出。整个过程是离线的、单阶段的,不需要单独的奖励头,也不需要 PPO 中的价值网络与滚动采样。

DPO在优化人类偏好的同时避免强化学习。现有方法先拟合奖励模型再用RL求最大化策略;DPO以简单分类目标直接优化最符合偏好的策略,拟合隐式奖励模型并可闭式得到对应最优策略。
1. DPO在优化人类偏好的同时避免强化学习。现有方法先拟合奖励模型再用RL求最大化策略;DPO以简单分类目标直接优化最符合偏好的策略,拟合隐式奖励模型并可闭式得到对应最优策略。

03结果与证据

理论部分证明:在常见偏好模型假设下,最大化该分类目标等价于求解原 RLHF 约束优化问题的最优策略,从而把“先奖后策”两阶段流程压缩为直接策略学习。推导不依赖特定网络结构,适用于以自回归语言模型为策略的设定。

实证叙述与后续复现表明,在成对偏好数据上用该损失微调,能够获得与传统 RLHF 流程可比的对齐行为,同时实现更简单、更易稳定的训练管线。本文不引入具体分数对比,重点在于方法等价性与工程可实施性,而非榜单数字。

SurveyMonkey问卷布局。每位受访者完成25项格式相似的判断。
2. SurveyMonkey问卷布局。每位受访者完成25项格式相似的判断。

04影响与意义

DPO 极大降低了开源对齐的门槛:研究者只需偏好对与参考模型,即可用标准监督学习代码完成对齐,无需维护奖励模型与 PPO 基础设施。这一简化推动了大量复现、消融与教学材料的出现,使偏好优化成为更可普及的基线流程。

方法还引出 IPO、KTO、SimPO 等变体,分别从正则形式、是否需要成对数据、目标重参数等角度修正或扩展原损失。它表明许多看似必须在线强化学习的对齐问题,在合适的变分重写后可以变成稳定的离线目标,从而改变后续算法设计的默认起点。

05局限

DPO 对偏好噪声敏感:错误或不一致的成对标签会直接进入分类损失,缺乏显式奖励模型时更难做噪声建模或过滤。目标依赖离线偏好覆盖的行为分布,对分布外提示与回复的外推有限,策略可能过度拟合已见偏好对。

在需要多步探索、工具使用或复杂推理的任务上,仅靠静态偏好对往往不够,实践中仍常回到带在线采样的强化学习或迭代式数据收集。此外,参考策略与损失温度等选择会影响隐式奖励尺度,调参不当可能导致模式坍缩或更新不足。

06要点

  1. 01很多表面上的强化学习对齐问题,在最优策略的闭式关系下其实是变分或分类问题。
  2. 02稳定、可离线优化的损失比复杂的采样与 PPO 循环更容易普及和复现。
  3. 03对齐算法可以写得很短,但偏好数据的质量与覆盖范围不能相应变短。

为何入典

把对齐从 RL 工程问题简化成可稳定训练的损失。开源指令模型几乎都过一遍 DPO/ORPO。

标签

alignmentpreference

相关论文

和这篇论文对话

开启对话后,本页的标题、摘要、导读和图注会装进上下文。模型是你自己接入的。

登录后可以接入自己的模型,向这篇论文提问。