新篇智能体arXiv:2608.19197
SPADE:自适应可执行合成环境中的自博弈训练
SPADE: Self-Play in Adaptive Synthetic Executable Environments
Bo Liu, Simon Yu, Yiding Jiang, Ao Qu, Andrew Zhao, Zichen Liu, Junsu Kim, Zijian Zhou
arXiv 2608.19197 · 2026
0 引用 · 45 阅读 · 0 收藏
摘要
语言智能体持续自我改进需要不断扩展、多样且自适应的自生成目标,而现有训练环境池(人工策展、静态合成或冻结验证器)在学习者扩展时目标分布固定。SPADE 让同一 LLM 扮演环境设计者与推理智能体:前者以 Gym 风格 reset()/step() 接口编写完整长程可执行环境,后者在其中学习行动。设计者用带/不带特权提示的奖励差距估计遗憾,从而把环境对准智能体能力边界且保持可行。
Continuous self-improvement requires an ever-expanding pool of self-generated, diverse, adaptive goals. For language agents, existing training environment pools (hand-curated, statically synthesized, or frozen-verifier) keep the goal distribution fixed as the learner scales. We introduce SPADE (Self-Play in Adaptive Synthetic Executable Environments), a self-play RL framework in which a single LLM plays two roles: an Environment Designer that writes complete, long-horizon training environments as executable code with an OpenAI Gym-style reset()/step() interface, and a Reasoning Agent that learns to act in them. Each is a stateful, multi-turn environment (state transitions, reward functions, and verification code), so one interface spans reasoning problems and multi-step agentic tool use. The Reasoning Agent's regret is estimated using the gap between its reward with and without privileged hints; in optimizing this regret signal the Environment Designer learns to target environments at the edge of the agent's capabilities while keeping them feasible. Through extensive experimentation, we find several components critical to success: grounding the Environment Designer on documents sam
提要
SPADE 让同一 LLM 既编写带 Gym 式接口的可执行长程训练环境,又在其中作为推理智能体学习行动。它用有无特权提示的奖励差距估计遗憾,使环境难度贴着能力边界自适应扩展并保持可行。
01背景与动机
语言智能体若要持续自我改进,需要不断扩充、多样且随能力变化的目标池。现有训练环境多依赖人工策展、静态合成或冻结验证器;学习者变强后,目标分布仍固定,难度与多样性难以继续匹配能力。
因此需要一种能随智能体进步自动生成长程、可验证任务的机制。该机制应同时覆盖推理问题与多步工具使用,并以可执行代码保证可运行、可核验,避免目标池在规模扩展后迅速饱和。
02核心方法
SPADE 中单一 LLM 扮演双角色:环境设计者编写含状态转移、奖励与验证逻辑的完整长程环境,接口为 OpenAI Gym 风格的 reset()/step();推理智能体在其中行动。同一接口统一覆盖推理题与多步智能体式工具使用。
设计者以智能体在有、无特权提示下的奖励差距估计遗憾,并优化该信号,使环境落在当前能力边缘且仍可行。作者强调将设计者 grounded 到文档采样等组件,对整体成功至关重要。

03结果与证据
作者通过大量实验识别出若干关键组件,摘要中明确点名环境设计者的文档 grounding 等。框架以可执行代码环境统一推理与智能体式工具使用,并表明遗憾驱动的设计能针对当前能力自适应出题。
所给摘要未完整列出具体数值指标,故本文不编造分数或排行。现有叙述主要支持组件必要性,以及统一接口与遗憾调难度这一机制方向,而非提供可直接引用的完整基准对照表。

04影响与意义
SPADE 将“出题”与“答题”收束为同一模型上的自博弈,并以可执行验证替代冻结 verifier,为语言智能体提供可扩展的自生成课程。任务与策略可共同演化,而不是依赖外部固定题库。
这一路径有望缓解静态环境池随模型规模增长而饱和的问题,使训练目标分布随能力变化持续更新,在长程推理与工具使用场景中保持合适难度与多样性。

05局限
环境质量依赖设计者正确写出可执行代码与验证逻辑;遗憾估计则依赖特权提示设定是否合理。若代码不可运行或验证存在漏洞,训练信号会失真,进而影响自博弈稳定性。
摘要未充分报告失败模式、计算开销及相对强基线的完整对比。落地时仍需关注环境可运行性与奖励黑客风险,避免仅凭自博弈叙事高估方法的稳健性与可迁移性。
06要点
- 01可执行的 Gym 式环境把长程推理与多步工具使用训练统一到同一接口下。
- 02设计者与智能体自博弈,用有无特权提示的奖励差作为遗憾信号调节难度。
- 03文档 grounding 等工程组件被作者标为成功关键,而不是单靠自博弈口号。
标签
和这篇论文对话
开启对话后,本页的标题、摘要、导读和图注会装进上下文。模型是你自己接入的。