Curriculum
经典路线
十五条必读,按思想出现的顺序排列。不是引用数排行榜,而是一条能讲得通的故事:表示、深度、注意力、规模、对齐、推理。
- 01经典2013
词向量:把语义放进几何里
Efficient Estimation of Word Representations in Vector Space
分布式表示的大众入口。后来几乎所有语言模型都站在「词/token 是向量」这一步上。
Tomas Mikolov, Kai Chen, Greg Corrado et al. · ICLR Workshop
- 02经典2012
AlexNet:深度卷积真正赢了一次
ImageNet Classification with Deep Convolutional Neural Networks
深度学习的公开胜利。没有这场 ImageNet 竞赛,后来的 ResNet、ViT、CLIP 都不会以这种速度到来。
Alex Krizhevsky, Ilya Sutskever, Geoffrey E. Hinton · NeurIPS
- 03经典2015
Adam:几乎每个人都在用的优化器
Adam: A Method for Stochastic Optimization
训练基础设施。读懂 Adam,才能理解后续的学习率、权重衰减和自适应优化争论。
Diederik P. Kingma, Jimmy Ba · ICLR
- 04经典2016
ResNet:让网络真正变深
Deep Residual Learning for Image Recognition
深度可训练性的关键技巧。Transformer 里的残差流,本质上还是这篇论文的思想。
Kaiming He, Xiangyu Zhang, Shaoqing Ren et al. · CVPR
- 05经典2016
AlphaGo:搜索遇见深度学习
Mastering the game of Go with deep neural networks and tree search
把深度学习和规划搜索焊在一起。今天的推理模型、博弈智能体,都能在这里找到祖先。
David Silver, Aja Huang, Chris J. Maddison et al. · Nature
- 06经典2017
Transformer:注意力就够了
Attention Is All You Need
现代大模型的骨架。后面几乎所有突破,都是在这个编码器—解码器注意力机器上长出来的。
Ashish Vaswani, Noam Shazeer, Niki Parmar et al. · NeurIPS
- 07经典2019
BERT:双向预训练改变 NLP
BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding
「预训练 + 微调」成为范式。它让 NLP 从任务专用模型转向通用编码器。
Jacob Devlin, Ming-Wei Chang, Kenton Lee et al. · NAACL
- 08经典2020
GPT-3:上下文里的少样本学习
Language Models are Few-Shot Learners
它把「提示」变成接口。从此模型不只是分类器,而是可编程的文本机器。
Tom B. Brown, Benjamin Mann, Nick Ryder et al. · NeurIPS
- 09经典2020
缩放定律:损失随规模平滑下降
Scaling Laws for Neural Language Models
把炼模型从感觉变成预算问题。Chinchilla、LLaMA 的数据配比,都在回应这篇论文。
Jared Kaplan, Sam McCandlish, Tom Henighan et al. · arXiv
- 10经典2020
DDPM:把生成写成逐步去噪
Denoising Diffusion Probabilistic Models
稳定生成的主干。从图像到音频、视频、蛋白质,扩散成了新的默认生成引擎。
Jonathan Ho, Ajay Jain, Pieter Abbeel · NeurIPS
- 11经典2021
CLIP:用自然语言监督视觉
Learning Transferable Visual Models From Natural Language Supervision
多模态对齐的基准方法。文生图、以文检索、视觉智能体,几乎都还在用这条对比学习绳。
Alec Radford, Jong Wook Kim, Chris Hallacy et al. · ICML
- 12经典2022
InstructGPT:让模型听人话
Training language models to follow instructions with human feedback
ChatGPT 能成为产品,靠的不是更大的 GPT-3,而是这篇对齐流程。
Long Ouyang, Jeff Wu, Xu Jiang et al. · NeurIPS
- 13经典2022
思维链:把推理写在字面上
Chain-of-Thought Prompting Elicits Reasoning in Large Language Models
它让「让模型先想一想」成为标准操作。o1、R1、测试时计算,都从这里长出来。
Jason Wei, Xuezhi Wang, Dale Schuurmans et al. · NeurIPS
- 14经典2023
LLaMA:开放基础模型的分水岭
LLaMA: Open and Efficient Foundation Language Models
开源 LLM 生态的原点和坐标系。没有 LLaMA,就没有后来的 Alpaca、Vicuna、Llama 2/3 浪潮。
Hugo Touvron, Thibaut Lavril, Gautier Izacard et al. · arXiv
- 15经典2023
DPO:不用强化学习的偏好对齐
Direct Preference Optimization: Your Language Model is Secretly a Reward Model
把对齐从 RL 工程问题简化成可稳定训练的损失。开源指令模型几乎都过一遍 DPO/ORPO。
Rafael Rafailov, Archit Sharma, Eric Mitchell et al. · NeurIPS