探索/基础

经典基础arXiv:1706.03762

Transformer:注意力就够了

Attention Is All You Need

Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Łukasz Kaiser, Illia Polosukhin

NeurIPS · 2017

160k 引用 · 1.7k 阅读 · 0 收藏

摘要

提出完全基于自注意力的 Transformer,丢掉循环与卷积,在机器翻译上刷新质量并奠定并行训练的基础。

Introduces the Transformer, a sequence model based solely on self-attention, dispensing with recurrence and convolution while setting new translation quality.

提要

这篇论文把序列建模从逐步时间循环中解放出来,改用可并行的全局自注意力。它以编码器—解码器 Transformer 证明注意力足以支撑机器翻译等序列任务。

01背景与动机

循环网络按时间步串行计算,训练难以充分并行,长距离依赖也要穿过漫长路径,限制了大规模序列学习的效率与效果。

作者希望摆脱对循环与卷积的依赖,用全局可并行的注意力直接建模任意位置之间的关系,从而更好利用现代算力。

02核心方法

提出多层自注意力加前馈的编码器—解码器:用 Query-Key 点积计算权重,多头机制分槽捕捉不同类型关系,并配合残差与层归一化。

因无循环顺序,需加入位置编码;训练上采用 Adam、标签平滑等配方,使模型在翻译等序列任务上可以端到端并行优化。

Transformer 模型架构
1. Transformer 模型架构

03结果与证据

在机器翻译等基准上,Transformer 以纯注意力架构达到具有竞争力的质量,说明序列建模不必依赖逐步循环传递状态。

关键证据是:全局注意力加多头与标准训练配方,能够在可并行计算的前提下学习有效的对齐与表示,而非仅靠更深的循环堆叠。

(左)缩放点积注意力。(右)多头注意力由若干并行注意力层组成
2. (左)缩放点积注意力。(右)多头注意力由若干并行注意力层组成

04影响与意义

该架构成为大语言模型、视觉 Transformer、扩散 Transformer 以及多模态模型的共同技术祖先,重塑了表示学习的默认骨架。

它把研究重心转向缩放、位置编码、高效注意力与对齐数据,使「先并行训练、再谈结构变体」成为后续主流路线。

多头注意力:若干注意力层并行运行
3. 多头注意力:若干注意力层并行运行

05局限

原生自注意力具有序列长度上的二次复杂度,长上下文的显存与算力开销很快上升,制约了直接扩展窗口的能力。

相对卷积或循环,位置编码与局部归纳偏置较弱,长程外推、结构先验等往往需要后续工作修补与改进。

06要点

  1. 01并行训练比逐步循环更能有效吃到大规模算力。
  2. 02多头注意力不是装饰,而是把不同关系分槽建模的机制。
  3. 03先理解 QKV 注意力与位置编码,再去读后续所有变体会更清楚。

为何入典

现代大模型的骨架。后面几乎所有突破,都是在这个编码器—解码器注意力机器上长出来的。

标签

transformerattention

相关论文

和这篇论文对话

开启对话后,本页的标题、摘要、导读和图注会装进上下文。模型是你自己接入的。

登录后可以接入自己的模型,向这篇论文提问。