探索/智能体

经典智能体arXiv:2210.03629

ReAct:推理和行动写在同一条轨迹里

ReAct: Synergizing Reasoning and Acting in Language Models

Shunyu Yao, Jeffrey Zhao, Dian Yu, Nan Du, Izhak Shafran, Karthik Narasimhan, Yuan Cao

ICLR · 2023

5.0k 引用 · 1.6k 阅读 · 0 收藏

摘要

把思维链与具体行动交错起来,让语言模型能够规划、调用工具,并根据反馈更新信念。

Interleaves chain-of-thought reasoning with task-specific actions so language models can plan, call tools, and update beliefs from feedback.

提要

ReAct 把纯推理和纯行动拧成一条可追踪的 Thought–Action–Observation 轨迹。语言模型因此能在同一条轨迹里规划、调用工具,并根据观察更新信念。

01背景与动机

纯推理侧重内部推演与解释,纯行动侧重与环境交互和工具调用,两条线在早期工作中常被分开处理。ReAct 的动机是把它们写进同一条可追踪轨迹,使模型在任务中既能想清下一步,又能真正去查询与执行。

这表明语言模型可以作为智能体的控制器:边想边查,边做边改。把环境观察写回轨迹后,模型能依据新证据修正中间结论与后续计划,而不是仅依赖参数记忆、在无反馈条件下一次性给出答案。

02核心方法

提示格式固定为 Thought、Action、Observation 的循环:模型先写出当前推理与意图,再发出一个具体行动,环境返回观察后进入下一轮,直至给出最终答复。整条轨迹显式交错内部思考与外部交互。

行动空间包含搜索、查询等任务相关工具,以及结束并作答之类的控制动作。格式本身不绑定某一模型,重点是让推理步骤、工具调用与反馈按时间顺序对齐,便于阅读、干预与对照失败案例。

03结果与证据

在需要检索与多步决策的设定中,交错推理与行动有助于用外部观察约束后续思考,减轻仅靠参数记忆时的空洞断言,并提高中间过程的可解释性。与只推理或只行动的基线相比,同一轨迹上的反馈能及时改写计划。

证据形态主要是完整轨迹与任务成败对照,而非单一分数叙事。轨迹本身成为分析依据:可以看到模型为何查询、如何吸收观察、以及在哪一步偏离目标,从而支持提示改进与错误归类。

04影响与意义

ReAct 成为智能体框架、工具调用与相关评测中最小可运行的抽象之一。许多后续系统沿用“思考—行动—观察”循环作为编排骨架,把语言模型接到搜索、计算器或外部 API。

这一抽象降低了“模型如何边想边用工具”的概念成本,也使不同工作能在相近的轨迹格式上比较行为与失误模式。行动被明确为获取新证据的手段,而不只是最终答案的装饰步骤。

05局限

纯提示驱动的智能体仍然脆弱且难复现:同一套格式在不同模型、解码设置或工具返回噪声下,行为可能明显漂移。轨迹变长后,目标遗忘、重复行动与无效查询更容易出现。

长程任务因此往往还需要记忆与摘要、中间校验,以及比手写提示更强的策略学习或训练信号。仅扩大模型规模并不足以稳定扩展能力边界,工具设计与轨迹管理同样关键。

06要点

  1. 01行动是获取新证据并改写后续推理的方式,而不只是输出答案的最后一步。
  2. 02把思考暴露在轨迹里,失败才更容易被定位、对照和调试。
  3. 03精心设计的工具集往往比单纯放大模型更能拓展可完成任务的边界。

为何入典

智能体论文里被引用最多的接口之一。今天各种「思考 / 行动 / 观察」循环,基本是 ReAct 的子孙。

标签

agenttools

相关论文

和这篇论文对话

开启对话后,本页的标题、摘要、导读和图注会装进上下文。模型是你自己接入的。

登录后可以接入自己的模型,向这篇论文提问。