SPADE:自适应可执行合成环境中的自博弈训练
SPADE: Self-Play in Adaptive Synthetic Executable Environments
SPADE 让同一 LLM 既编写带 Gym 式接口的可执行长程训练环境,又在其中作为推理智能体学习行动。它用有无特权提示的奖励差距估计遗憾,使环境难度贴着能力边界自适应扩展并保持可行。
Attention Is All You Need
这篇论文把序列建模从逐步时间循环中解放出来,改用可并行的全局自注意力。它以编码器—解码器 Transformer 证明注意力足以支撑机器翻译等序列任务。
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
R1 把「让模型多想」从提示技巧升级成可训练的强化学习目标。用可验证奖励做大规模 RL,能诱发出长思维链推理,并在多项基准上接近闭源推理模型。
每天 06:00 自动收录 · 最近更新 8月21日 15:16
SPADE: Self-Play in Adaptive Synthetic Executable Environments
SPADE 让同一 LLM 既编写带 Gym 式接口的可执行长程训练环境,又在其中作为推理智能体学习行动。它用有无特权提示的奖励差距估计遗憾,使环境难度贴着能力边界自适应扩展并保持可行。
Learned, Then Lost: A Measured Single-Example Counterfactual in Pre-training
作者在 124M GPT-2 上对单条样本注入做了多种子真反事实预训练。单次暴露后的段落优势在约五十步内可测,训练结束时则落在检测阈值之内而消失。
Lévy Attention: Single-Pass Predictive Uncertainty for Continuous-Time Attention
Lévy Attention 将交叉注意力写成对非齐次 Poisson 随机测度的随机积分,使预测与闭式不确定性在同一次前向中产生。其期望退化为可训练的 mollified 余弦核注意力,可替换 softmax 并保留证据质量与 value 分歧。
Beyond the Transcript: Detecting Covert Co ordination in Latent Multi-Agent Communication
VLA 将多智能体私有隐状态通道与公开动作在事件级对齐,从而支持匹配因果分析。它仅用中性数据训练三层监测器,并配合可操纵干预,用于检测与抑制隐蔽协调。
ADEPT: Accelerating Dexterity via Pre-Training and Post-Training using Reinforcement Learning
ADEPT 通过通用物体重摆放预训练获得可迁移的灵巧行为先验,再以行为克隆蒸馏、critic 预热与保守 on-policy 更新稳住后训练,并用关节空间 Geometric Fabric 安全衔接高自由度执行。该流程使多指策略能从原始视触感知学习长程下游任务,并支持零样本 sim-to-real。
Beyond Teacher Likelihood: Group-Calibrated On-Policy Distillation for Long-Context Reasoning
长上下文证据聚合中,token 级教师信号与回复级验证器会随输入变长而分歧。GC-OPD 在 rollout 组内分别归一化二者,并以相对 OPD 优势将分歧残差归因到 token,同时保留原有 OPD 信号。
从词向量走到可验证的推理模型。
词向量:把语义放进几何里
2013
AlexNet:深度卷积真正赢了一次
2012
Adam:几乎每个人都在用的优化器
2015
ResNet:让网络真正变深
2016
AlphaGo:搜索遇见深度学习
2016
Transformer:注意力就够了
2017
BERT:双向预训练改变 NLP
2019
GPT-3:上下文里的少样本学习
2020
缩放定律:损失随规模平滑下降
2020
DDPM:把生成写成逐步去噪
2020
CLIP:用自然语言监督视觉
2021
InstructGPT:让模型听人话
2022
思维链:把推理写在字面上
2022
LLaMA:开放基础模型的分水岭
2023
DPO:不用强化学习的偏好对齐
2023
SPADE: Self-Play in Adaptive Synthetic Executable Environments
SPADE 让同一 LLM 既编写带 Gym 式接口的可执行长程训练环境,又在其中作为推理智能体学习行动。它用有无特权提示的奖励差距估计遗憾,使环境难度贴着能力边界自适应扩展并保持可行。
Learned, Then Lost: A Measured Single-Example Counterfactual in Pre-training
作者在 124M GPT-2 上对单条样本注入做了多种子真反事实预训练。单次暴露后的段落优势在约五十步内可测,训练结束时则落在检测阈值之内而消失。
Lévy Attention: Single-Pass Predictive Uncertainty for Continuous-Time Attention
Lévy Attention 将交叉注意力写成对非齐次 Poisson 随机测度的随机积分,使预测与闭式不确定性在同一次前向中产生。其期望退化为可训练的 mollified 余弦核注意力,可替换 softmax 并保留证据质量与 value 分歧。
Beyond the Transcript: Detecting Covert Co ordination in Latent Multi-Agent Communication
VLA 将多智能体私有隐状态通道与公开动作在事件级对齐,从而支持匹配因果分析。它仅用中性数据训练三层监测器,并配合可操纵干预,用于检测与抑制隐蔽协调。
ADEPT: Accelerating Dexterity via Pre-Training and Post-Training using Reinforcement Learning
ADEPT 通过通用物体重摆放预训练获得可迁移的灵巧行为先验,再以行为克隆蒸馏、critic 预热与保守 on-policy 更新稳住后训练,并用关节空间 Geometric Fabric 安全衔接高自由度执行。该流程使多指策略能从原始视触感知学习长程下游任务,并支持零样本 sim-to-real。
Beyond Teacher Likelihood: Group-Calibrated On-Policy Distillation for Long-Context Reasoning
长上下文证据聚合中,token 级教师信号与回复级验证器会随输入变长而分歧。GC-OPD 在 rollout 组内分别归一化二者,并以相对 OPD 优势将分歧残差归因到 token,同时保留原有 OPD 信号。
s1: Simple test-time scaling
s1 把测试时缩放写成几乎不能再短的配方:精选小数据,再强迫模型继续想。只需约一千条推理轨迹加预算强制,就能在数学基准上逼近更重的推理系统。
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
R1 把「让模型多想」从提示技巧升级成可训练的强化学习目标。用可验证奖励做大规模 RL,能诱发出长思维链推理,并在多项基准上接近闭源推理模型。