Curriculum

经典路线

十五条必读,按思想出现的顺序排列。不是引用数排行榜,而是一条能讲得通的故事:表示、深度、注意力、规模、对齐、推理。

  1. 01
    经典2013

    词向量:把语义放进几何里

    Efficient Estimation of Word Representations in Vector Space

    分布式表示的大众入口。后来几乎所有语言模型都站在「词/token 是向量」这一步上。

    Tomas Mikolov, Kai Chen, Greg Corrado et al. · ICLR Workshop

  2. 02
    经典2012

    AlexNet:深度卷积真正赢了一次

    ImageNet Classification with Deep Convolutional Neural Networks

    深度学习的公开胜利。没有这场 ImageNet 竞赛,后来的 ResNet、ViT、CLIP 都不会以这种速度到来。

    Alex Krizhevsky, Ilya Sutskever, Geoffrey E. Hinton · NeurIPS

  3. 03
    经典2015

    Adam:几乎每个人都在用的优化器

    Adam: A Method for Stochastic Optimization

    训练基础设施。读懂 Adam,才能理解后续的学习率、权重衰减和自适应优化争论。

    Diederik P. Kingma, Jimmy Ba · ICLR

  4. 04
    经典2016

    ResNet:让网络真正变深

    Deep Residual Learning for Image Recognition

    深度可训练性的关键技巧。Transformer 里的残差流,本质上还是这篇论文的思想。

    Kaiming He, Xiangyu Zhang, Shaoqing Ren et al. · CVPR

  5. 05
    经典2016

    AlphaGo:搜索遇见深度学习

    Mastering the game of Go with deep neural networks and tree search

    把深度学习和规划搜索焊在一起。今天的推理模型、博弈智能体,都能在这里找到祖先。

    David Silver, Aja Huang, Chris J. Maddison et al. · Nature

  6. 06
    经典2017

    Transformer:注意力就够了

    Attention Is All You Need

    现代大模型的骨架。后面几乎所有突破,都是在这个编码器—解码器注意力机器上长出来的。

    Ashish Vaswani, Noam Shazeer, Niki Parmar et al. · NeurIPS

  7. 07
    经典2019

    BERT:双向预训练改变 NLP

    BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding

    「预训练 + 微调」成为范式。它让 NLP 从任务专用模型转向通用编码器。

    Jacob Devlin, Ming-Wei Chang, Kenton Lee et al. · NAACL

  8. 08
    经典2020

    GPT-3:上下文里的少样本学习

    Language Models are Few-Shot Learners

    它把「提示」变成接口。从此模型不只是分类器,而是可编程的文本机器。

    Tom B. Brown, Benjamin Mann, Nick Ryder et al. · NeurIPS

  9. 09
    经典2020

    缩放定律:损失随规模平滑下降

    Scaling Laws for Neural Language Models

    把炼模型从感觉变成预算问题。Chinchilla、LLaMA 的数据配比,都在回应这篇论文。

    Jared Kaplan, Sam McCandlish, Tom Henighan et al. · arXiv

  10. 10
    经典2020

    DDPM:把生成写成逐步去噪

    Denoising Diffusion Probabilistic Models

    稳定生成的主干。从图像到音频、视频、蛋白质,扩散成了新的默认生成引擎。

    Jonathan Ho, Ajay Jain, Pieter Abbeel · NeurIPS

  11. 11
    经典2021

    CLIP:用自然语言监督视觉

    Learning Transferable Visual Models From Natural Language Supervision

    多模态对齐的基准方法。文生图、以文检索、视觉智能体,几乎都还在用这条对比学习绳。

    Alec Radford, Jong Wook Kim, Chris Hallacy et al. · ICML

  12. 12
    经典2022

    InstructGPT:让模型听人话

    Training language models to follow instructions with human feedback

    ChatGPT 能成为产品,靠的不是更大的 GPT-3,而是这篇对齐流程。

    Long Ouyang, Jeff Wu, Xu Jiang et al. · NeurIPS

  13. 13
    经典2022

    思维链:把推理写在字面上

    Chain-of-Thought Prompting Elicits Reasoning in Large Language Models

    它让「让模型先想一想」成为标准操作。o1、R1、测试时计算,都从这里长出来。

    Jason Wei, Xuezhi Wang, Dale Schuurmans et al. · NeurIPS

  14. 14
    经典2023

    LLaMA:开放基础模型的分水岭

    LLaMA: Open and Efficient Foundation Language Models

    开源 LLM 生态的原点和坐标系。没有 LLaMA,就没有后来的 Alpaca、Vicuna、Llama 2/3 浪潮。

    Hugo Touvron, Thibaut Lavril, Gautier Izacard et al. · arXiv

  15. 15
    经典2023

    DPO:不用强化学习的偏好对齐

    Direct Preference Optimization: Your Language Model is Secretly a Reward Model

    把对齐从 RL 工程问题简化成可稳定训练的损失。开源指令模型几乎都过一遍 DPO/ORPO。

    Rafael Rafailov, Archit Sharma, Eric Mitchell et al. · NeurIPS

同样值得放进书架