GC-OPD:用组校准对齐长上下文推理中的教师与验证器
Beyond Teacher Likelihood: Group-Calibrated On-Policy Distillation for Long-Context Reasoning
长上下文证据聚合中,token 级教师信号与回复级验证器会随输入变长而分歧。GC-OPD 在 rollout 组内分别归一化二者,并以相对 OPD 优势将分歧残差归因到 token,同时保留原有 OPD 信号。
按时代、领域或关键词筛选。经典是骨架,新篇每天早上 6 点从 arXiv 自动收入。
Beyond Teacher Likelihood: Group-Calibrated On-Policy Distillation for Long-Context Reasoning
长上下文证据聚合中,token 级教师信号与回复级验证器会随输入变长而分歧。GC-OPD 在 rollout 组内分别归一化二者,并以相对 OPD 优势将分歧残差归因到 token,同时保留原有 OPD 信号。
s1: Simple test-time scaling
s1 把测试时缩放写成几乎不能再短的配方:精选小数据,再强迫模型继续想。只需约一千条推理轨迹加预算强制,就能在数学基准上逼近更重的推理系统。
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
R1 把「让模型多想」从提示技巧升级成可训练的强化学习目标。用可验证奖励做大规模 RL,能诱发出长思维链推理,并在多项基准上接近闭源推理模型。
DeepSeek-V3 Technical Report
V3 证明开源模型可以用远低于同级闭源的训练成本进入第一梯队。报告给出总参数约 6710 亿、每 token 激活约 370 亿的 MoE,并在多项基准上追平领先闭源模型。
DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model
DeepSeek-V2 把「便宜地推理」写成架构问题:用多头潜在注意力压缩 KV 缓存,并用细粒度专家降低训练与服务成本。它在保持语言能力竞争力的同时,为后续更大规模开源模型铺路。
Mixtral of Experts
Mixtral 把稀疏混合专家从封闭实验室带回可部署的开源模型。每个 token 只激活八个专家中的两个,以更低的激活算力追平更密的模型。