SPADE:自适应可执行合成环境中的自博弈训练
SPADE: Self-Play in Adaptive Synthetic Executable Environments
SPADE 让同一 LLM 既编写带 Gym 式接口的可执行长程训练环境,又在其中作为推理智能体学习行动。它用有无特权提示的奖励差距估计遗憾,使环境难度贴着能力边界自适应扩展并保持可行。
按时代、领域或关键词筛选。经典是骨架,新篇每天早上 6 点从 arXiv 自动收入。
SPADE: Self-Play in Adaptive Synthetic Executable Environments
SPADE 让同一 LLM 既编写带 Gym 式接口的可执行长程训练环境,又在其中作为推理智能体学习行动。它用有无特权提示的奖励差距估计遗憾,使环境难度贴着能力边界自适应扩展并保持可行。
Beyond the Transcript: Detecting Covert Co ordination in Latent Multi-Agent Communication
VLA 将多智能体私有隐状态通道与公开动作在事件级对齐,从而支持匹配因果分析。它仅用中性数据训练三层监测器,并配合可操纵干预,用于检测与抑制隐蔽协调。
SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering
SWE-agent 把智能体研究从「更好的提示」推进到「更好的工具表面」。它表明在软件工程任务上,专用智能体—计算机接口的设计本身会显著影响成功率,而不只取决于基座语言模型。
Tree of Thoughts: Deliberate Problem Solving with Large Language Models
ToT 把生成看成在思维空间里做搜索,而不是一条直线写到底。它通过分叉、评估与回溯,让语言模型在需要探索的任务上更审慎地求解。
Generative Agents: Interactive Simulacra of Human Behavior
这篇论文把「角色扮演」升级成带长期记忆的行为模拟。智能体通过记忆流、反思与检索在沙盒中规划,并展现可信的社会行为。
ReAct: Synergizing Reasoning and Acting in Language Models
ReAct 把纯推理和纯行动拧成一条可追踪的 Thought–Action–Observation 轨迹。语言模型因此能在同一条轨迹里规划、调用工具,并根据观察更新信念。