SPADE:自适应可执行合成环境中的自博弈训练
SPADE: Self-Play in Adaptive Synthetic Executable Environments
SPADE 让同一 LLM 既编写带 Gym 式接口的可执行长程训练环境,又在其中作为推理智能体学习行动。它用有无特权提示的奖励差距估计遗憾,使环境难度贴着能力边界自适应扩展并保持可行。
按时代、领域或关键词筛选。经典是骨架,新篇每天早上 6 点从 arXiv 自动收入。
SPADE: Self-Play in Adaptive Synthetic Executable Environments
SPADE 让同一 LLM 既编写带 Gym 式接口的可执行长程训练环境,又在其中作为推理智能体学习行动。它用有无特权提示的奖励差距估计遗憾,使环境难度贴着能力边界自适应扩展并保持可行。
Beyond the Transcript: Detecting Covert Co ordination in Latent Multi-Agent Communication
VLA 将多智能体私有隐状态通道与公开动作在事件级对齐,从而支持匹配因果分析。它仅用中性数据训练三层监测器,并配合可操纵干预,用于检测与抑制隐蔽协调。
Learned, Then Lost: A Measured Single-Example Counterfactual in Pre-training
作者在 124M GPT-2 上对单条样本注入做了多种子真反事实预训练。单次暴露后的段落优势在约五十步内可测,训练结束时则落在检测阈值之内而消失。
Lévy Attention: Single-Pass Predictive Uncertainty for Continuous-Time Attention
Lévy Attention 将交叉注意力写成对非齐次 Poisson 随机测度的随机积分,使预测与闭式不确定性在同一次前向中产生。其期望退化为可训练的 mollified 余弦核注意力,可替换 softmax 并保留证据质量与 value 分歧。
Beyond Teacher Likelihood: Group-Calibrated On-Policy Distillation for Long-Context Reasoning
长上下文证据聚合中,token 级教师信号与回复级验证器会随输入变长而分歧。GC-OPD 在 rollout 组内分别归一化二者,并以相对 OPD 优势将分歧残差归因到 token,同时保留原有 OPD 信号。
ADEPT: Accelerating Dexterity via Pre-Training and Post-Training using Reinforcement Learning
ADEPT 通过通用物体重摆放预训练获得可迁移的灵巧行为先验,再以行为克隆蒸馏、critic 预热与保守 on-policy 更新稳住后训练,并用关节空间 Geometric Fabric 安全衔接高自由度执行。该流程使多指策略能从原始视触感知学习长程下游任务,并支持零样本 sim-to-real。
s1: Simple test-time scaling
s1 把测试时缩放写成几乎不能再短的配方:精选小数据,再强迫模型继续想。只需约一千条推理轨迹加预算强制,就能在数学基准上逼近更重的推理系统。
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
R1 把「让模型多想」从提示技巧升级成可训练的强化学习目标。用可验证奖励做大规模 RL,能诱发出长思维链推理,并在多项基准上接近闭源推理模型。
DeepSeek-V3 Technical Report
V3 证明开源模型可以用远低于同级闭源的训练成本进入第一梯队。报告给出总参数约 6710 亿、每 token 激活约 370 亿的 MoE,并在多项基准上追平领先闭源模型。
DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model
DeepSeek-V2 把「便宜地推理」写成架构问题:用多头潜在注意力压缩 KV 缓存,并用细粒度专家降低训练与服务成本。它在保持语言能力竞争力的同时,为后续更大规模开源模型铺路。
SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering
SWE-agent 把智能体研究从「更好的提示」推进到「更好的工具表面」。它表明在软件工程任务上,专用智能体—计算机接口的设计本身会显著影响成功率,而不只取决于基座语言模型。
Mixtral of Experts
Mixtral 把稀疏混合专家从封闭实验室带回可部署的开源模型。每个 token 只激活八个专家中的两个,以更低的激活算力追平更密的模型。
Mamba: Linear-Time Sequence Modeling with Selective State Spaces
Mamba 提出带输入选择的状态空间模型,在线性时间下沿序列过滤信息。它重新打开一个问题:注意力是否是序列建模的唯一终点。
Direct Preference Optimization: Your Language Model is Secretly a Reward Model
DPO 从标准 RLHF 目标推出最优策略的闭式形式,使偏好对齐可写成对所选与拒绝回复的分类损失。它表明不必单独训练奖励模型或运行 PPO,最优策略已隐含在奖励与参考策略的数学关系中。
Tree of Thoughts: Deliberate Problem Solving with Large Language Models
ToT 把生成看成在思维空间里做搜索,而不是一条直线写到底。它通过分叉、评估与回溯,让语言模型在需要探索的任务上更审慎地求解。
Generative Agents: Interactive Simulacra of Human Behavior
这篇论文把「角色扮演」升级成带长期记忆的行为模拟。智能体通过记忆流、反思与检索在沙盒中规划,并展现可信的社会行为。
Segment Anything
SAM 把分割从依赖预定义类别的任务,改写成可接受点、框等输入的通用提示接口。配合数据引擎与大规模掩码数据,模型能在零样本条件下为提示生成可用掩码。
LLaMA: Open and Efficient Foundation Language Models
LLaMA 证明:训练配方与数据质量,可以让小一个数量级的开放模型在多项任务上追平更大的封闭模型。它把基础模型研究从 API 黑盒拉回可下载、可微调的公开权重。
ReAct: Synergizing Reasoning and Acting in Language Models
ReAct 把纯推理和纯行动拧成一条可追踪的 Thought–Action–Observation 轨迹。语言模型因此能在同一条轨迹里规划、调用工具,并根据观察更新信念。
FlashAttention: Fast and Memory-Efficient Exact Attention
FlashAttention 提醒我们:注意力的瓶颈经常是搬数据,不是算 FLOPs。它按 GPU SRAM 做分块并在反向重算中间量,得到与标准算法等价的精确注意力,同时大幅减少显存读写。
Training language models to follow instructions with human feedback
InstructGPT 把擅长续写的 GPT-3 变成更会按指令做事的模型,使对齐成为主路径而非附录。它通过指令监督与人类反馈强化学习,让输出更符合用户意图,并在人类评价中更受偏好。
Chain-of-Thought Prompting Elicits Reasoning in Large Language Models
思维链把内部计算外化为文本,使推理不再被压成一个直接答案。在提示中写入中间步骤,能显著提升大模型在算术、常识和符号任务上的表现。
High-Resolution Image Synthesis with Latent Diffusion Models
潜在扩散把感知压缩与语义生成拆开,使高分辨率图像合成的算力成本远低于像素空间扩散。生成式图像因此第一次具备真正可普及的训练与部署门槛。
Highly accurate protein structure prediction with AlphaFold
AlphaFold2 把结构预测从竞赛指标变成可以辅助实验的工具。它用基于注意力的模型对进化与几何约束推理,以接近原子级精度给出结构并附带置信度。
LoRA: Low-Rank Adaptation of Large Language Models
LoRA 冻结预训练权重,只在注意力投影中注入可训练低秩矩阵,用远少的参数逼近全量微调。它把微调从复制整模,变成存储和切换几份小矩阵。
Learning Transferable Visual Models From Natural Language Supervision
CLIP 在约四亿图文对上对比训练图像与文本编码器,使二者落入同一向量空间。由此,自然语言提示词可以直接充当分类器,实现零样本视觉识别。
An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale
ViT 表明卷积并非视觉识别的必要条件:当预训练规模足够时,纯注意力机制也能学到有效表征。它把图像切成 patch 当作 token,用标准 Transformer 编码器完成分类。
Denoising Diffusion Probabilistic Models
DDPM 用「先加噪再学会去噪」替代 GAN 式对抗训练,以更稳的优化和更好的分布覆盖做生成。它把扩散概率模型与去噪分数匹配对齐,通过反转加噪过程实现高质量图像合成。
Language Models are Few-Shot Learners
GPT-3 把模型规模转化为可迁移的能力,使同一套语言模型能在上下文中表现少样本学习。任务适应不必总是更新参数,而更多转向提示与示例设计。
Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks
RAG承认语言模型记不住全世界,于是把世界放回文档库里。它把稠密检索器与序列生成模型接成一体,让参数记忆与外部文档共同支撑知识密集型任务。
Scaling Laws for Neural Language Models
缩放定律表明,在很宽的范围内,预训练损失会随模型、数据与算力规模可预测地下降,而不是突然碰壁。它把大模型预训练从反复试错,推进为可以按预算规划的工程问题。
Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer
T5 把分类、翻译、摘要与问答等任务统一成同一种文本到文本的生成问题。它以大规模对照实验厘清预训练目标、架构与数据的影响,而不是只发布一个更强的模型。
BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding
BERT 证明双向上下文预训练可以把一个编码器变成多数理解任务的通用底座。它用掩码语言建模弥补单向预训练的不足,并确立了先预训练再微调的主流流程。
Attention Is All You Need
这篇论文把序列建模从逐步时间循环中解放出来,改用可并行的全局自注意力。它以编码器—解码器 Transformer 证明注意力足以支撑机器翻译等序列任务。
Mastering the game of Go with deep neural networks and tree search
AlphaGo 将神经网络直觉与树搜索规划闭环结合,而非单靠其中一方。它在完整围棋上达到超人类水平,并为后续自我对弈与测试时计算路线提供了样板。
Deep Residual Learning for Image Recognition
ResNet 指出深层网络的退化主要来自优化路径而非深度本身,并通过恒等捷径使残差学习可行。该结构让极深网络变得可训练,并成为后来各类架构的默认骨架。
Adam: A Method for Stochastic Optimization
Adam 把一阶动量与二阶量级估计写入同一更新规则,使大多数深度模型更容易开箱训练。它显著降低了学习率手调负担,并成为跨架构的常用默认优化器。
Generative Adversarial Nets
GAN 通过生成器与判别器的对抗训练,让模型学习生成「像真的」样本,而不是最大化显式似然。它以隐含密度绕开配分函数,并深刻影响了后续生成建模与对抗学习路线。
Efficient Estimation of Word Representations in Vector Space
Word2Vec 证明,在足够大的无监督语料上可以学出支持算术运算的语义空间。词与词之间的几何关系能够稳定地反映类比等语义规律。
ImageNet Classification with Deep Convolutional Neural Networks
AlexNet 表明,更深的卷积网络配合 GPU 训练可以在大规模视觉识别上取得决定性优势。它把端到端卷积学习推成计算机视觉的主流路线。