探索/大模型

新篇大模型arXiv:2501.12948

DeepSeek-R1:用强化学习把推理训出来

DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

DeepSeek-AI

arXiv · 2025

2.8k 引用 · 1.7k 阅读 · 0 收藏

摘要

表明用可验证奖励做大规模强化学习,可以诱发出长思维链推理,并在多项基准上接近闭源推理模型。

Shows that large-scale reinforcement learning with verifiable rewards can elicit long chain-of-thought reasoning, matching proprietary reasoning models.

提要

R1 把「让模型多想」从提示技巧升级成可训练的强化学习目标。用可验证奖励做大规模 RL,能诱发出长思维链推理,并在多项基准上接近闭源推理模型。

01背景与动机

复杂推理长期依赖提示工程或昂贵的人工思维链标注,成本高、难扩展,也难以把「多想一步」变成稳定可优化的训练目标。社区需要能在结果可检查的任务上自动给奖、从而激励模型自发延长推理的路径。

本文动机是检验:纯强化学习能否涌现反思、纠错与长思维链。团队先训练几乎不靠监督微调的 R1-Zero 展示涌现行为,再借助冷启动数据与后续训练得到更可读、更易用的 R1,衔接研究原型与可发布模型。

02核心方法

核心做法是在数学、代码等答案可自动验证的任务上,仅用最终结果对错作为奖励,开展大规模强化学习,而不依赖逐步过程标注。模型为提高通过率,被激励写出更长、含自我检查与修正的思维链。

旗舰推理模型训练完成后,再将长链推理行为蒸馏到密集小模型,使较小参数量也能继承类似推理模式。整体把可验证任务上的结果监督,转化为可迁移的测试时计算能力。

PPO与GRPO在MATH任务上的表现。
1. PPO与GRPO在MATH任务上的表现。

03结果与证据

证据上,纯 RL 的 R1-Zero 已能涌现反思、纠错与冗长推理轨迹,说明长思维链不必完全靠人工示范才能出现。经冷启动与后续阶段得到的 R1,在保持强推理取向的同时提升了可读性与使用体验。

论文表明 R1 在多项基准上接近闭源推理模型;此处不引具体分项分数。定性结论是:可验证奖励下的大规模 RL,足以把「多想」练成稳定策略,并可通过蒸馏传递给更小模型。

DeepSeek-R1在ChatBotArena上的风格控制排名。截图于2025年1月24日(模型发布一周后)获取;排名随投票数增加实时动态更新。
2. DeepSeek-R1在ChatBotArena上的风格控制排名。截图于2025年1月24日(模型发布一周后)获取;排名随投票数增加实时动态更新。

04影响与意义

R1 把开源推理推到可与 o1 类系统对照讨论的位置,使「用强化学习激励长推理」成为可公开复现的路线,而不只是闭源实验室的提示技巧或内部工艺。

其发布推动了围绕复现、改进与蒸馏的广泛跟进,强化了「能自动打分的任务最适合 RL」以及「推理能力可由旗舰流向小模型」等共识,影响后续开源基座与应用侧的技术选型。

2025年1月24日DeepSeek-R1在各方面的排名。
3. 2025年1月24日DeepSeek-R1在各方面的排名。

05局限

方法强依赖可自动验证的奖励信号,因此在开放域写作、含糊偏好或缺乏标准答案的任务上更难直接套用,往往需要额外的奖励建模或其他对齐手段。

冗长思维链会增加延迟与推理成本,并可能带来新的安全与可控性议题,例如不当思路在长链中的展开。如何在效果、效率与安全之间取得平衡,仍是后续工作的重点。

06要点

  1. 01能自动打分、结果可验证的任务,最适合用强化学习激励推理。
  2. 02长思维链是一种可学习的测试时计算,而不只是提示出来的格式。
  3. 03蒸馏可以把旗舰模型上练出的推理行为迁移到密集小模型。

标签

reasoningRLopen-source

相关论文

和这篇论文对话

开启对话后,本页的标题、摘要、导读和图注会装进上下文。模型是你自己接入的。

登录后可以接入自己的模型,向这篇论文提问。