新篇大模型arXiv:2501.12948
DeepSeek-R1:用强化学习把推理训出来
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
DeepSeek-AI
arXiv · 2025
2.8k 引用 · 1.7k 阅读 · 0 收藏
摘要
表明用可验证奖励做大规模强化学习,可以诱发出长思维链推理,并在多项基准上接近闭源推理模型。
Shows that large-scale reinforcement learning with verifiable rewards can elicit long chain-of-thought reasoning, matching proprietary reasoning models.
提要
R1 把「让模型多想」从提示技巧升级成可训练的强化学习目标。用可验证奖励做大规模 RL,能诱发出长思维链推理,并在多项基准上接近闭源推理模型。
01背景与动机
复杂推理长期依赖提示工程或昂贵的人工思维链标注,成本高、难扩展,也难以把「多想一步」变成稳定可优化的训练目标。社区需要能在结果可检查的任务上自动给奖、从而激励模型自发延长推理的路径。
本文动机是检验:纯强化学习能否涌现反思、纠错与长思维链。团队先训练几乎不靠监督微调的 R1-Zero 展示涌现行为,再借助冷启动数据与后续训练得到更可读、更易用的 R1,衔接研究原型与可发布模型。
02核心方法
核心做法是在数学、代码等答案可自动验证的任务上,仅用最终结果对错作为奖励,开展大规模强化学习,而不依赖逐步过程标注。模型为提高通过率,被激励写出更长、含自我检查与修正的思维链。
旗舰推理模型训练完成后,再将长链推理行为蒸馏到密集小模型,使较小参数量也能继承类似推理模式。整体把可验证任务上的结果监督,转化为可迁移的测试时计算能力。

03结果与证据
证据上,纯 RL 的 R1-Zero 已能涌现反思、纠错与冗长推理轨迹,说明长思维链不必完全靠人工示范才能出现。经冷启动与后续阶段得到的 R1,在保持强推理取向的同时提升了可读性与使用体验。
论文表明 R1 在多项基准上接近闭源推理模型;此处不引具体分项分数。定性结论是:可验证奖励下的大规模 RL,足以把「多想」练成稳定策略,并可通过蒸馏传递给更小模型。

04影响与意义
R1 把开源推理推到可与 o1 类系统对照讨论的位置,使「用强化学习激励长推理」成为可公开复现的路线,而不只是闭源实验室的提示技巧或内部工艺。
其发布推动了围绕复现、改进与蒸馏的广泛跟进,强化了「能自动打分的任务最适合 RL」以及「推理能力可由旗舰流向小模型」等共识,影响后续开源基座与应用侧的技术选型。

05局限
方法强依赖可自动验证的奖励信号,因此在开放域写作、含糊偏好或缺乏标准答案的任务上更难直接套用,往往需要额外的奖励建模或其他对齐手段。
冗长思维链会增加延迟与推理成本,并可能带来新的安全与可控性议题,例如不当思路在长链中的展开。如何在效果、效率与安全之间取得平衡,仍是后续工作的重点。
06要点
- 01能自动打分、结果可验证的任务,最适合用强化学习激励推理。
- 02长思维链是一种可学习的测试时计算,而不只是提示出来的格式。
- 03蒸馏可以把旗舰模型上练出的推理行为迁移到密集小模型。
标签
相关论文
InstructGPT:让模型听人话
Training language models to follow instructions with human feedback
思维链:把推理写在字面上
Chain-of-Thought Prompting Elicits Reasoning in Large Language Models
DPO:不用强化学习的偏好对齐
Direct Preference Optimization: Your Language Model is Secretly a Reward Model
DeepSeek-V3:开源 MoE 的新基线
DeepSeek-V3 Technical Report
s1:最简单的测试时缩放
s1: Simple test-time scaling
和这篇论文对话
开启对话后,本页的标题、摘要、导读和图注会装进上下文。模型是你自己接入的。