经典基础arXiv:1706.03762
Transformer:注意力就够了
Attention Is All You Need
Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Łukasz Kaiser, Illia Polosukhin
NeurIPS · 2017
160k 引用 · 1.7k 阅读 · 0 收藏
摘要
提出完全基于自注意力的 Transformer,丢掉循环与卷积,在机器翻译上刷新质量并奠定并行训练的基础。
Introduces the Transformer, a sequence model based solely on self-attention, dispensing with recurrence and convolution while setting new translation quality.
提要
这篇论文把序列建模从逐步时间循环中解放出来,改用可并行的全局自注意力。它以编码器—解码器 Transformer 证明注意力足以支撑机器翻译等序列任务。
01背景与动机
循环网络按时间步串行计算,训练难以充分并行,长距离依赖也要穿过漫长路径,限制了大规模序列学习的效率与效果。
作者希望摆脱对循环与卷积的依赖,用全局可并行的注意力直接建模任意位置之间的关系,从而更好利用现代算力。
02核心方法
提出多层自注意力加前馈的编码器—解码器:用 Query-Key 点积计算权重,多头机制分槽捕捉不同类型关系,并配合残差与层归一化。
因无循环顺序,需加入位置编码;训练上采用 Adam、标签平滑等配方,使模型在翻译等序列任务上可以端到端并行优化。

03结果与证据
在机器翻译等基准上,Transformer 以纯注意力架构达到具有竞争力的质量,说明序列建模不必依赖逐步循环传递状态。
关键证据是:全局注意力加多头与标准训练配方,能够在可并行计算的前提下学习有效的对齐与表示,而非仅靠更深的循环堆叠。

04影响与意义
该架构成为大语言模型、视觉 Transformer、扩散 Transformer 以及多模态模型的共同技术祖先,重塑了表示学习的默认骨架。
它把研究重心转向缩放、位置编码、高效注意力与对齐数据,使「先并行训练、再谈结构变体」成为后续主流路线。

05局限
原生自注意力具有序列长度上的二次复杂度,长上下文的显存与算力开销很快上升,制约了直接扩展窗口的能力。
相对卷积或循环,位置编码与局部归纳偏置较弱,长程外推、结构先验等往往需要后续工作修补与改进。
06要点
- 01并行训练比逐步循环更能有效吃到大规模算力。
- 02多头注意力不是装饰,而是把不同关系分槽建模的机制。
- 03先理解 QKV 注意力与位置编码,再去读后续所有变体会更清楚。
为何入典
现代大模型的骨架。后面几乎所有突破,都是在这个编码器—解码器注意力机器上长出来的。
标签
相关论文
BERT:双向预训练改变 NLP
BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding
ViT:图像也是一串 token
An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale
FlashAttention:把注意力写成 IO 感知算法
FlashAttention: Fast and Memory-Efficient Exact Attention
GPT-3:上下文里的少样本学习
Language Models are Few-Shot Learners
和这篇论文对话
开启对话后,本页的标题、摘要、导读和图注会装进上下文。模型是你自己接入的。