探索/大模型

经典大模型arXiv:2201.11903

思维链:把推理写在字面上

Chain-of-Thought Prompting Elicits Reasoning in Large Language Models

Jason Wei, Xuezhi Wang, Dale Schuurmans, Maarten Bosma, Brian Ichter, Fei Xia, Ed Chi, Quoc Le, Denny Zhou

NeurIPS · 2022

16k 引用 · 1.7k 阅读 · 0 收藏

摘要

在提示中给出中间推理步骤,能显著提升大模型在算术、常识和符号任务上的表现。

Shows that providing intermediate reasoning steps in prompts dramatically improves large-model performance on arithmetic, commonsense, and symbolic tasks.

提要

思维链把内部计算外化为文本,使推理不再被压成一个直接答案。在提示中写入中间步骤,能显著提升大模型在算术、常识和符号任务上的表现。

01背景与动机

在标准提示设定下,大模型常被要求直接给出最终答案,多步算术、常识与符号问题的中间计算被压进一次生成,错误难以检查与修正。这类任务因此成为衡量模型是否真正具备推理能力的重要试金石。

研究者发现,当模型规模足够大时,它们会跟随示例中的逐步推理格式,把解题过程显式写在输出里,从而显著提升复杂任务表现。这表明合适的提示可以解锁模型内部已有、却未被直接答案格式激活的推理能力。

02核心方法

方法的核心是在少样本提示中写入完整解题步骤:每个示例不仅给出答案,还包含从问题到结论的中间推导。模型在测试时会模仿这一格式,将内部计算展开为可读的文本推理链。

此外,也可采用零样本思维链:无需编写多条示范,只需在问题后加上「Let's think step by step」等触发语,即可诱导模型自行逐步思考。两种方式都把推理过程外化为生成内容的一部分。

思维链提示使大语言模型能处理复杂算术、常识与符号推理任务。思维链推理过程已高亮标出。
1. 思维链提示使大语言模型能处理复杂算术、常识与符号推理任务。思维链推理过程已高亮标出。

03结果与证据

在算术应用题、常识推理以及符号操作等任务上,思维链提示相对直接回答带来了明显提升。改进主要出现在足够大的模型上,说明规模是跟随并利用逐步格式的前提条件。

论文并未把思维链等同于保证正确的算法,而是展示了中间步骤作为额外测试时计算的价值:模型有更多生成空间来分解问题,从而在若干基准上取得更强表现。

04影响与意义

思维链启发了后续大量工作,包括对多条推理路径投票的自我一致性、以树状搜索扩展思路的思维树,以及针对中间步骤的过程奖励模型。

更长的思维链与强化学习结合,进一步把可写出来的推理过程变成可优化的对象,形成从提示工程到训练目标的一整条研究脉络。

05局限

逐步写出的文本并不等于可验证的真实算法执行。模型常常生成读起来连贯、结构完整的推理,却在关键计算或逻辑环节出错,最终答案仍然错误。

因此仅靠结果监督不够,过程监督变得必要:需要检查或奖励中间步骤的正确性,而不能只看最终答案是否匹配。可读性带来了可检验性,也暴露了表面流畅与实质正确之间的差距。

06要点

  1. 01中间步骤相当于额外的测试时计算资源。
  2. 02能力阈值出现在模型规模之后,而不是单靠提示技巧。
  3. 03可读的推理既便于人工检验,也便于被过程奖励利用。

为何入典

它让「让模型先想一想」成为标准操作。o1、R1、测试时计算,都从这里长出来。

标签

reasoningprompting

相关论文

和这篇论文对话

开启对话后,本页的标题、摘要、导读和图注会装进上下文。模型是你自己接入的。

登录后可以接入自己的模型,向这篇论文提问。