新篇大模型arXiv:2501.19393
s1:最简单的测试时缩放
s1: Simple test-time scaling
Niklas Muennighoff, Zitong Yang, Weijia Shi, Xiang Lisa Li, Li Fei-Fei, Hannaneh Hajishirzi, Luke Zettlemoyer, Percy Liang, Emmanuel Candès, Tatsunori Hashimoto
arXiv · 2025
600 引用 · 1.5k 阅读 · 0 收藏
摘要
表明只需精选的少量推理轨迹,再配合强制延长思考的预算技巧,就能在数学基准上逼近更重的推理系统。
Shows that a small curated set of reasoning traces plus a budget-forcing trick can match much heavier reasoning systems on math benchmarks.
提要
s1 把测试时缩放写成几乎不能再短的配方:精选小数据,再强迫模型继续想。只需约一千条推理轨迹加预算强制,就能在数学基准上逼近更重的推理系统。
01背景与动机
近期关于推理模型的主流叙事往往强调:只有经过大规模强化学习与巨量算力,才能获得可靠的逐步推理能力。s1明确挑战这一看法,主张不必先搭建沉重的训练管线,也能在数学基准上接近更复杂的推理系统。
作者将焦点从「训练阶段无限加码」转向两件更可操作的事情:如何策展少量但高质量的推理轨迹,以及如何在解码阶段显式分配并延长思考预算。这一转向意在说明,数据质量与测试时计算同样关键,从而为资源有限的学术实验室打开另一条可复现路径。
02核心方法
方法的一端是数据:作者从已有强推理系统产生的轨迹中仔细精选约一千条高质量样本,再用监督微调将基础模型对齐到清晰、可逐步检验的推理风格,从而避开大规模强化学习所带来的训练复杂度与成本。
另一端是解码阶段的控制:所谓预算强制,是在生成过程中通过简单干预迫使模型不要过早结束思考,而是继续输出中间推理内容。由此,「想得更久」变成可调节的测试时计算分配,而不是一次写死的固定生成长度。

03结果与证据
在数学相关基准上的对照表明,仅用约一千条精选推理轨迹做微调、并在测试时施加预算强制的模型,能够在整体表现上逼近训练流程或系统规模更重的推理方案,而无需复现对方的完整强化学习栈与数据规模。
证据的重点并不在于宣称某一固定榜单名次,而在于说明极简配方本身有效:干净的小规模数据负责塑造推理格式,预算强制负责在解码时分配额外计算。两者结合,即可在可验证的数学任务上呈现清晰的测试时缩放趋势。

04影响与意义
对学术实验室而言,s1把「做出可用推理模型」从依赖封闭的大规模强化学习流水线,拉回到可公开讨论的数据策展与解码控制技巧,从而明显降低了复现实验、消融分析与公平对照的工程与算力门槛。
更广一点看,它提醒研究社区:测试时可用的计算应被视为一等公民。与其只横向比较预训练或强化学习的规模,不如同时清楚报告思考预算如何被分配与使用,以及在相近预算下,简单基线能否接近宣传中的复杂推理系统。
05局限
该方法强依赖已有的高质量推理轨迹:若没有更强教师模型或精心人工标注来提供示范,约一千条样本的策展本身就难以起步,因此它更接近站在已有推理能力之上的蒸馏与预算调度,而不是从零训练中凭空涌现推理。
此外,主要验证集中在答案可自动核对的数学基准之上;在开放域问答、长文写作或缺乏明确核对信号的任务上,强制延长思考是否仍能稳定带来收益,以及是否会放大空洞赘述或错误自信,仍有待更系统的检验。
06要点
- 01少而干净的推理轨迹,可以在效果上胜过规模更大但噪声更多的数据。
- 02在测试时强制模型多想,本质上是一种显式的计算资源分配。
- 03结构简单的基线,常常足以刺破复杂系统过度包装的宣传叙事。
标签
相关论文
思维链:把推理写在字面上
Chain-of-Thought Prompting Elicits Reasoning in Large Language Models
思维树:让语言模型学会分叉与回溯
Tree of Thoughts: Deliberate Problem Solving with Large Language Models
DeepSeek-R1:用强化学习把推理训出来
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
和这篇论文对话
开启对话后,本页的标题、摘要、导读和图注会装进上下文。模型是你自己接入的。