探索/大模型

新篇大模型arXiv:2501.19393

s1:最简单的测试时缩放

s1: Simple test-time scaling

Niklas Muennighoff, Zitong Yang, Weijia Shi, Xiang Lisa Li, Li Fei-Fei, Hannaneh Hajishirzi, Luke Zettlemoyer, Percy Liang, Emmanuel Candès, Tatsunori Hashimoto

arXiv · 2025

600 引用 · 1.5k 阅读 · 0 收藏

摘要

表明只需精选的少量推理轨迹,再配合强制延长思考的预算技巧,就能在数学基准上逼近更重的推理系统。

Shows that a small curated set of reasoning traces plus a budget-forcing trick can match much heavier reasoning systems on math benchmarks.

提要

s1 把测试时缩放写成几乎不能再短的配方:精选小数据,再强迫模型继续想。只需约一千条推理轨迹加预算强制,就能在数学基准上逼近更重的推理系统。

01背景与动机

近期关于推理模型的主流叙事往往强调:只有经过大规模强化学习与巨量算力,才能获得可靠的逐步推理能力。s1明确挑战这一看法,主张不必先搭建沉重的训练管线,也能在数学基准上接近更复杂的推理系统。

作者将焦点从「训练阶段无限加码」转向两件更可操作的事情:如何策展少量但高质量的推理轨迹,以及如何在解码阶段显式分配并延长思考预算。这一转向意在说明,数据质量与测试时计算同样关键,从而为资源有限的学术实验室打开另一条可复现路径。

02核心方法

方法的一端是数据:作者从已有强推理系统产生的轨迹中仔细精选约一千条高质量样本,再用监督微调将基础模型对齐到清晰、可逐步检验的推理风格,从而避开大规模强化学习所带来的训练复杂度与成本。

另一端是解码阶段的控制:所谓预算强制,是在生成过程中通过简单干预迫使模型不要过早结束思考,而是继续输出中间推理内容。由此,「想得更久」变成可调节的测试时计算分配,而不是一次写死的固定生成长度。

(a) 通过预算强制实现的顺序扩展
1. (a) 通过预算强制实现的顺序扩展

03结果与证据

在数学相关基准上的对照表明,仅用约一千条精选推理轨迹做微调、并在测试时施加预算强制的模型,能够在整体表现上逼近训练流程或系统规模更重的推理方案,而无需复现对方的完整强化学习栈与数据规模。

证据的重点并不在于宣称某一固定榜单名次,而在于说明极简配方本身有效:干净的小规模数据负责塑造推理格式,预算强制负责在解码时分配额外计算。两者结合,即可在可验证的数学任务上呈现清晰的测试时缩放趋势。

(b) 通过多数投票实现的并行扩展
2. (b) 通过多数投票实现的并行扩展

04影响与意义

对学术实验室而言,s1把「做出可用推理模型」从依赖封闭的大规模强化学习流水线,拉回到可公开讨论的数据策展与解码控制技巧,从而明显降低了复现实验、消融分析与公平对照的工程与算力门槛。

更广一点看,它提醒研究社区:测试时可用的计算应被视为一等公民。与其只横向比较预训练或强化学习的规模,不如同时清楚报告思考预算如何被分配与使用,以及在相近预算下,简单基线能否接近宣传中的复杂推理系统。

05局限

该方法强依赖已有的高质量推理轨迹:若没有更强教师模型或精心人工标注来提供示范,约一千条样本的策展本身就难以起步,因此它更接近站在已有推理能力之上的蒸馏与预算调度,而不是从零训练中凭空涌现推理。

此外,主要验证集中在答案可自动核对的数学基准之上;在开放域问答、长文写作或缺乏明确核对信号的任务上,强制延长思考是否仍能稳定带来收益,以及是否会放大空洞赘述或错误自信,仍有待更系统的检验。

06要点

  1. 01少而干净的推理轨迹,可以在效果上胜过规模更大但噪声更多的数据。
  2. 02在测试时强制模型多想,本质上是一种显式的计算资源分配。
  3. 03结构简单的基线,常常足以刺破复杂系统过度包装的宣传叙事。

标签

reasoningtest-time

相关论文

和这篇论文对话

开启对话后,本页的标题、摘要、导读和图注会装进上下文。模型是你自己接入的。

登录后可以接入自己的模型,向这篇论文提问。