SPADE:自适应可执行合成环境中的自博弈训练
SPADE: Self-Play in Adaptive Synthetic Executable Environments
SPADE 让同一 LLM 既编写带 Gym 式接口的可执行长程训练环境,又在其中作为推理智能体学习行动。它用有无特权提示的奖励差距估计遗憾,使环境难度贴着能力边界自适应扩展并保持可行。
按时代、领域或关键词筛选。经典是骨架,新篇每天早上 6 点从 arXiv 自动收入。
SPADE: Self-Play in Adaptive Synthetic Executable Environments
SPADE 让同一 LLM 既编写带 Gym 式接口的可执行长程训练环境,又在其中作为推理智能体学习行动。它用有无特权提示的奖励差距估计遗憾,使环境难度贴着能力边界自适应扩展并保持可行。
Beyond the Transcript: Detecting Covert Co ordination in Latent Multi-Agent Communication
VLA 将多智能体私有隐状态通道与公开动作在事件级对齐,从而支持匹配因果分析。它仅用中性数据训练三层监测器,并配合可操纵干预,用于检测与抑制隐蔽协调。
Learned, Then Lost: A Measured Single-Example Counterfactual in Pre-training
作者在 124M GPT-2 上对单条样本注入做了多种子真反事实预训练。单次暴露后的段落优势在约五十步内可测,训练结束时则落在检测阈值之内而消失。
Lévy Attention: Single-Pass Predictive Uncertainty for Continuous-Time Attention
Lévy Attention 将交叉注意力写成对非齐次 Poisson 随机测度的随机积分,使预测与闭式不确定性在同一次前向中产生。其期望退化为可训练的 mollified 余弦核注意力,可替换 softmax 并保留证据质量与 value 分歧。
Beyond Teacher Likelihood: Group-Calibrated On-Policy Distillation for Long-Context Reasoning
长上下文证据聚合中,token 级教师信号与回复级验证器会随输入变长而分歧。GC-OPD 在 rollout 组内分别归一化二者,并以相对 OPD 优势将分歧残差归因到 token,同时保留原有 OPD 信号。
ADEPT: Accelerating Dexterity via Pre-Training and Post-Training using Reinforcement Learning
ADEPT 通过通用物体重摆放预训练获得可迁移的灵巧行为先验,再以行为克隆蒸馏、critic 预热与保守 on-policy 更新稳住后训练,并用关节空间 Geometric Fabric 安全衔接高自由度执行。该流程使多指策略能从原始视触感知学习长程下游任务,并支持零样本 sim-to-real。
s1: Simple test-time scaling
s1 把测试时缩放写成几乎不能再短的配方:精选小数据,再强迫模型继续想。只需约一千条推理轨迹加预算强制,就能在数学基准上逼近更重的推理系统。
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
R1 把「让模型多想」从提示技巧升级成可训练的强化学习目标。用可验证奖励做大规模 RL,能诱发出长思维链推理,并在多项基准上接近闭源推理模型。
DeepSeek-V3 Technical Report
V3 证明开源模型可以用远低于同级闭源的训练成本进入第一梯队。报告给出总参数约 6710 亿、每 token 激活约 370 亿的 MoE,并在多项基准上追平领先闭源模型。
DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model
DeepSeek-V2 把「便宜地推理」写成架构问题:用多头潜在注意力压缩 KV 缓存,并用细粒度专家降低训练与服务成本。它在保持语言能力竞争力的同时,为后续更大规模开源模型铺路。
SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering
SWE-agent 把智能体研究从「更好的提示」推进到「更好的工具表面」。它表明在软件工程任务上,专用智能体—计算机接口的设计本身会显著影响成功率,而不只取决于基座语言模型。
Mixtral of Experts
Mixtral 把稀疏混合专家从封闭实验室带回可部署的开源模型。每个 token 只激活八个专家中的两个,以更低的激活算力追平更密的模型。
Mamba: Linear-Time Sequence Modeling with Selective State Spaces
Mamba 提出带输入选择的状态空间模型,在线性时间下沿序列过滤信息。它重新打开一个问题:注意力是否是序列建模的唯一终点。
Tree of Thoughts: Deliberate Problem Solving with Large Language Models
ToT 把生成看成在思维空间里做搜索,而不是一条直线写到底。它通过分叉、评估与回溯,让语言模型在需要探索的任务上更审慎地求解。
Generative Agents: Interactive Simulacra of Human Behavior
这篇论文把「角色扮演」升级成带长期记忆的行为模拟。智能体通过记忆流、反思与检索在沙盒中规划,并展现可信的社会行为。
Segment Anything
SAM 把分割从依赖预定义类别的任务,改写成可接受点、框等输入的通用提示接口。配合数据引擎与大规模掩码数据,模型能在零样本条件下为提示生成可用掩码。