DPO:不用强化学习的偏好对齐
Direct Preference Optimization: Your Language Model is Secretly a Reward Model
DPO 从标准 RLHF 目标推出最优策略的闭式形式,使偏好对齐可写成对所选与拒绝回复的分类损失。它表明不必单独训练奖励模型或运行 PPO,最优策略已隐含在奖励与参考策略的数学关系中。
按时代、领域或关键词筛选。经典是骨架,新篇每天早上 6 点从 arXiv 自动收入。
Direct Preference Optimization: Your Language Model is Secretly a Reward Model
DPO 从标准 RLHF 目标推出最优策略的闭式形式,使偏好对齐可写成对所选与拒绝回复的分类损失。它表明不必单独训练奖励模型或运行 PPO,最优策略已隐含在奖励与参考策略的数学关系中。
LLaMA: Open and Efficient Foundation Language Models
LLaMA 证明:训练配方与数据质量,可以让小一个数量级的开放模型在多项任务上追平更大的封闭模型。它把基础模型研究从 API 黑盒拉回可下载、可微调的公开权重。
ReAct: Synergizing Reasoning and Acting in Language Models
ReAct 把纯推理和纯行动拧成一条可追踪的 Thought–Action–Observation 轨迹。语言模型因此能在同一条轨迹里规划、调用工具,并根据观察更新信念。
FlashAttention: Fast and Memory-Efficient Exact Attention
FlashAttention 提醒我们:注意力的瓶颈经常是搬数据,不是算 FLOPs。它按 GPU SRAM 做分块并在反向重算中间量,得到与标准算法等价的精确注意力,同时大幅减少显存读写。
Training language models to follow instructions with human feedback
InstructGPT 把擅长续写的 GPT-3 变成更会按指令做事的模型,使对齐成为主路径而非附录。它通过指令监督与人类反馈强化学习,让输出更符合用户意图,并在人类评价中更受偏好。
Chain-of-Thought Prompting Elicits Reasoning in Large Language Models
思维链把内部计算外化为文本,使推理不再被压成一个直接答案。在提示中写入中间步骤,能显著提升大模型在算术、常识和符号任务上的表现。
High-Resolution Image Synthesis with Latent Diffusion Models
潜在扩散把感知压缩与语义生成拆开,使高分辨率图像合成的算力成本远低于像素空间扩散。生成式图像因此第一次具备真正可普及的训练与部署门槛。
Highly accurate protein structure prediction with AlphaFold
AlphaFold2 把结构预测从竞赛指标变成可以辅助实验的工具。它用基于注意力的模型对进化与几何约束推理,以接近原子级精度给出结构并附带置信度。
LoRA: Low-Rank Adaptation of Large Language Models
LoRA 冻结预训练权重,只在注意力投影中注入可训练低秩矩阵,用远少的参数逼近全量微调。它把微调从复制整模,变成存储和切换几份小矩阵。
Learning Transferable Visual Models From Natural Language Supervision
CLIP 在约四亿图文对上对比训练图像与文本编码器,使二者落入同一向量空间。由此,自然语言提示词可以直接充当分类器,实现零样本视觉识别。
An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale
ViT 表明卷积并非视觉识别的必要条件:当预训练规模足够时,纯注意力机制也能学到有效表征。它把图像切成 patch 当作 token,用标准 Transformer 编码器完成分类。
Denoising Diffusion Probabilistic Models
DDPM 用「先加噪再学会去噪」替代 GAN 式对抗训练,以更稳的优化和更好的分布覆盖做生成。它把扩散概率模型与去噪分数匹配对齐,通过反转加噪过程实现高质量图像合成。
Language Models are Few-Shot Learners
GPT-3 把模型规模转化为可迁移的能力,使同一套语言模型能在上下文中表现少样本学习。任务适应不必总是更新参数,而更多转向提示与示例设计。
Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks
RAG承认语言模型记不住全世界,于是把世界放回文档库里。它把稠密检索器与序列生成模型接成一体,让参数记忆与外部文档共同支撑知识密集型任务。
Scaling Laws for Neural Language Models
缩放定律表明,在很宽的范围内,预训练损失会随模型、数据与算力规模可预测地下降,而不是突然碰壁。它把大模型预训练从反复试错,推进为可以按预算规划的工程问题。
Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer
T5 把分类、翻译、摘要与问答等任务统一成同一种文本到文本的生成问题。它以大规模对照实验厘清预训练目标、架构与数据的影响,而不是只发布一个更强的模型。
BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding
BERT 证明双向上下文预训练可以把一个编码器变成多数理解任务的通用底座。它用掩码语言建模弥补单向预训练的不足,并确立了先预训练再微调的主流流程。
Attention Is All You Need
这篇论文把序列建模从逐步时间循环中解放出来,改用可并行的全局自注意力。它以编码器—解码器 Transformer 证明注意力足以支撑机器翻译等序列任务。
Mastering the game of Go with deep neural networks and tree search
AlphaGo 将神经网络直觉与树搜索规划闭环结合,而非单靠其中一方。它在完整围棋上达到超人类水平,并为后续自我对弈与测试时计算路线提供了样板。
Deep Residual Learning for Image Recognition
ResNet 指出深层网络的退化主要来自优化路径而非深度本身,并通过恒等捷径使残差学习可行。该结构让极深网络变得可训练,并成为后来各类架构的默认骨架。
Adam: A Method for Stochastic Optimization
Adam 把一阶动量与二阶量级估计写入同一更新规则,使大多数深度模型更容易开箱训练。它显著降低了学习率手调负担,并成为跨架构的常用默认优化器。
Generative Adversarial Nets
GAN 通过生成器与判别器的对抗训练,让模型学习生成「像真的」样本,而不是最大化显式似然。它以隐含密度绕开配分函数,并深刻影响了后续生成建模与对抗学习路线。
Efficient Estimation of Word Representations in Vector Space
Word2Vec 证明,在足够大的无监督语料上可以学出支持算术运算的语义空间。词与词之间的几何关系能够稳定地反映类比等语义规律。
ImageNet Classification with Deep Convolutional Neural Networks
AlexNet 表明,更深的卷积网络配合 GPU 训练可以在大规模视觉识别上取得决定性优势。它把端到端卷积学习推成计算机视觉的主流路线。