DPO:不用强化学习的偏好对齐
Direct Preference Optimization: Your Language Model is Secretly a Reward Model
DPO 从标准 RLHF 目标推出最优策略的闭式形式,使偏好对齐可写成对所选与拒绝回复的分类损失。它表明不必单独训练奖励模型或运行 PPO,最优策略已隐含在奖励与参考策略的数学关系中。
按时代、领域或关键词筛选。经典是骨架,新篇每天早上 6 点从 arXiv 自动收入。
Direct Preference Optimization: Your Language Model is Secretly a Reward Model
DPO 从标准 RLHF 目标推出最优策略的闭式形式,使偏好对齐可写成对所选与拒绝回复的分类损失。它表明不必单独训练奖励模型或运行 PPO,最优策略已隐含在奖励与参考策略的数学关系中。
LLaMA: Open and Efficient Foundation Language Models
LLaMA 证明:训练配方与数据质量,可以让小一个数量级的开放模型在多项任务上追平更大的封闭模型。它把基础模型研究从 API 黑盒拉回可下载、可微调的公开权重。
Training language models to follow instructions with human feedback
InstructGPT 把擅长续写的 GPT-3 变成更会按指令做事的模型,使对齐成为主路径而非附录。它通过指令监督与人类反馈强化学习,让输出更符合用户意图,并在人类评价中更受偏好。
Chain-of-Thought Prompting Elicits Reasoning in Large Language Models
思维链把内部计算外化为文本,使推理不再被压成一个直接答案。在提示中写入中间步骤,能显著提升大模型在算术、常识和符号任务上的表现。
LoRA: Low-Rank Adaptation of Large Language Models
LoRA 冻结预训练权重,只在注意力投影中注入可训练低秩矩阵,用远少的参数逼近全量微调。它把微调从复制整模,变成存储和切换几份小矩阵。
Language Models are Few-Shot Learners
GPT-3 把模型规模转化为可迁移的能力,使同一套语言模型能在上下文中表现少样本学习。任务适应不必总是更新参数,而更多转向提示与示例设计。
Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks
RAG承认语言模型记不住全世界,于是把世界放回文档库里。它把稠密检索器与序列生成模型接成一体,让参数记忆与外部文档共同支撑知识密集型任务。
Scaling Laws for Neural Language Models
缩放定律表明,在很宽的范围内,预训练损失会随模型、数据与算力规模可预测地下降,而不是突然碰壁。它把大模型预训练从反复试错,推进为可以按预算规划的工程问题。
Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer
T5 把分类、翻译、摘要与问答等任务统一成同一种文本到文本的生成问题。它以大规模对照实验厘清预训练目标、架构与数据的影响,而不是只发布一个更强的模型。
BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding
BERT 证明双向上下文预训练可以把一个编码器变成多数理解任务的通用底座。它用掩码语言建模弥补单向预训练的不足,并确立了先预训练再微调的主流流程。