经典大模型arXiv:2201.11903
思维链:把推理写在字面上
Chain-of-Thought Prompting Elicits Reasoning in Large Language Models
Jason Wei, Xuezhi Wang, Dale Schuurmans, Maarten Bosma, Brian Ichter, Fei Xia, Ed Chi, Quoc Le, Denny Zhou
NeurIPS · 2022
16k 引用 · 1.7k 阅读 · 0 收藏
摘要
在提示中给出中间推理步骤,能显著提升大模型在算术、常识和符号任务上的表现。
Shows that providing intermediate reasoning steps in prompts dramatically improves large-model performance on arithmetic, commonsense, and symbolic tasks.
提要
思维链把内部计算外化为文本,使推理不再被压成一个直接答案。在提示中写入中间步骤,能显著提升大模型在算术、常识和符号任务上的表现。
01背景与动机
在标准提示设定下,大模型常被要求直接给出最终答案,多步算术、常识与符号问题的中间计算被压进一次生成,错误难以检查与修正。这类任务因此成为衡量模型是否真正具备推理能力的重要试金石。
研究者发现,当模型规模足够大时,它们会跟随示例中的逐步推理格式,把解题过程显式写在输出里,从而显著提升复杂任务表现。这表明合适的提示可以解锁模型内部已有、却未被直接答案格式激活的推理能力。
02核心方法
方法的核心是在少样本提示中写入完整解题步骤:每个示例不仅给出答案,还包含从问题到结论的中间推导。模型在测试时会模仿这一格式,将内部计算展开为可读的文本推理链。
此外,也可采用零样本思维链:无需编写多条示范,只需在问题后加上「Let's think step by step」等触发语,即可诱导模型自行逐步思考。两种方式都把推理过程外化为生成内容的一部分。

03结果与证据
在算术应用题、常识推理以及符号操作等任务上,思维链提示相对直接回答带来了明显提升。改进主要出现在足够大的模型上,说明规模是跟随并利用逐步格式的前提条件。
论文并未把思维链等同于保证正确的算法,而是展示了中间步骤作为额外测试时计算的价值:模型有更多生成空间来分解问题,从而在若干基准上取得更强表现。
04影响与意义
思维链启发了后续大量工作,包括对多条推理路径投票的自我一致性、以树状搜索扩展思路的思维树,以及针对中间步骤的过程奖励模型。
更长的思维链与强化学习结合,进一步把可写出来的推理过程变成可优化的对象,形成从提示工程到训练目标的一整条研究脉络。
05局限
逐步写出的文本并不等于可验证的真实算法执行。模型常常生成读起来连贯、结构完整的推理,却在关键计算或逻辑环节出错,最终答案仍然错误。
因此仅靠结果监督不够,过程监督变得必要:需要检查或奖励中间步骤的正确性,而不能只看最终答案是否匹配。可读性带来了可检验性,也暴露了表面流畅与实质正确之间的差距。
06要点
- 01中间步骤相当于额外的测试时计算资源。
- 02能力阈值出现在模型规模之后,而不是单靠提示技巧。
- 03可读的推理既便于人工检验,也便于被过程奖励利用。
为何入典
它让「让模型先想一想」成为标准操作。o1、R1、测试时计算,都从这里长出来。
标签
相关论文
思维树:让语言模型学会分叉与回溯
Tree of Thoughts: Deliberate Problem Solving with Large Language Models
DeepSeek-R1:用强化学习把推理训出来
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
GPT-3:上下文里的少样本学习
Language Models are Few-Shot Learners
s1:最简单的测试时缩放
s1: Simple test-time scaling
和这篇论文对话
开启对话后,本页的标题、摘要、导读和图注会装进上下文。模型是你自己接入的。