GC-OPD:用组校准对齐长上下文推理中的教师与验证器
Beyond Teacher Likelihood: Group-Calibrated On-Policy Distillation for Long-Context Reasoning
长上下文证据聚合中,token 级教师信号与回复级验证器会随输入变长而分歧。GC-OPD 在 rollout 组内分别归一化二者,并以相对 OPD 优势将分歧残差归因到 token,同时保留原有 OPD 信号。
按时代、领域或关键词筛选。经典是骨架,新篇每天早上 6 点从 arXiv 自动收入。
Beyond Teacher Likelihood: Group-Calibrated On-Policy Distillation for Long-Context Reasoning
长上下文证据聚合中,token 级教师信号与回复级验证器会随输入变长而分歧。GC-OPD 在 rollout 组内分别归一化二者,并以相对 OPD 优势将分歧残差归因到 token,同时保留原有 OPD 信号。
s1: Simple test-time scaling
s1 把测试时缩放写成几乎不能再短的配方:精选小数据,再强迫模型继续想。只需约一千条推理轨迹加预算强制,就能在数学基准上逼近更重的推理系统。
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
R1 把「让模型多想」从提示技巧升级成可训练的强化学习目标。用可验证奖励做大规模 RL,能诱发出长思维链推理,并在多项基准上接近闭源推理模型。
DeepSeek-V3 Technical Report
V3 证明开源模型可以用远低于同级闭源的训练成本进入第一梯队。报告给出总参数约 6710 亿、每 token 激活约 370 亿的 MoE,并在多项基准上追平领先闭源模型。
DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model
DeepSeek-V2 把「便宜地推理」写成架构问题:用多头潜在注意力压缩 KV 缓存,并用细粒度专家降低训练与服务成本。它在保持语言能力竞争力的同时,为后续更大规模开源模型铺路。
Mixtral of Experts
Mixtral 把稀疏混合专家从封闭实验室带回可部署的开源模型。每个 token 只激活八个专家中的两个,以更低的激活算力追平更密的模型。
Direct Preference Optimization: Your Language Model is Secretly a Reward Model
DPO 从标准 RLHF 目标推出最优策略的闭式形式,使偏好对齐可写成对所选与拒绝回复的分类损失。它表明不必单独训练奖励模型或运行 PPO,最优策略已隐含在奖励与参考策略的数学关系中。
LLaMA: Open and Efficient Foundation Language Models
LLaMA 证明:训练配方与数据质量,可以让小一个数量级的开放模型在多项任务上追平更大的封闭模型。它把基础模型研究从 API 黑盒拉回可下载、可微调的公开权重。
Training language models to follow instructions with human feedback
InstructGPT 把擅长续写的 GPT-3 变成更会按指令做事的模型,使对齐成为主路径而非附录。它通过指令监督与人类反馈强化学习,让输出更符合用户意图,并在人类评价中更受偏好。
Chain-of-Thought Prompting Elicits Reasoning in Large Language Models
思维链把内部计算外化为文本,使推理不再被压成一个直接答案。在提示中写入中间步骤,能显著提升大模型在算术、常识和符号任务上的表现。
LoRA: Low-Rank Adaptation of Large Language Models
LoRA 冻结预训练权重,只在注意力投影中注入可训练低秩矩阵,用远少的参数逼近全量微调。它把微调从复制整模,变成存储和切换几份小矩阵。
Language Models are Few-Shot Learners
GPT-3 把模型规模转化为可迁移的能力,使同一套语言模型能在上下文中表现少样本学习。任务适应不必总是更新参数,而更多转向提示与示例设计。
Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks
RAG承认语言模型记不住全世界,于是把世界放回文档库里。它把稠密检索器与序列生成模型接成一体,让参数记忆与外部文档共同支撑知识密集型任务。
Scaling Laws for Neural Language Models
缩放定律表明,在很宽的范围内,预训练损失会随模型、数据与算力规模可预测地下降,而不是突然碰壁。它把大模型预训练从反复试错,推进为可以按预算规划的工程问题。
Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer
T5 把分类、翻译、摘要与问答等任务统一成同一种文本到文本的生成问题。它以大规模对照实验厘清预训练目标、架构与数据的影响,而不是只发布一个更强的模型。
BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding
BERT 证明双向上下文预训练可以把一个编码器变成多数理解任务的通用底座。它用掩码语言建模弥补单向预训练的不足,并确立了先预训练再微调的主流流程。