探索/大模型

经典大模型arXiv:1910.10683

T5:所有 NLP 都是文本生成

Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer

Colin Raffel, Noam Shazeer, Adam Roberts, Katherine Lee, Sharan Narang, Michael Matena, Yanqi Zhou, Wei Li, Peter J. Liu

JMLR · 2020

28k 引用 · 1.5k 阅读 · 0 收藏

摘要

把所有 NLP 任务写成「文本进、文本出」,并系统比较预训练目标、数据和规模的影响。

Casts every NLP problem as text-to-text generation and systematically studies pretraining objectives, data, and scale.

提要

T5 把分类、翻译、摘要与问答等任务统一成同一种文本到文本的生成问题。它以大规模对照实验厘清预训练目标、架构与数据的影响,而不是只发布一个更强的模型。

01背景与动机

此前自然语言处理常为不同任务设计不同架构与损失函数,流水线碎片化严重;同时许多工作只公布最终模型,缺少在统一设定下比较目标函数、架构与数据的系统对照,难以判断增益究竟来自何处。

T5 的动机是提供一份超大规模、设定清晰的预训练对照实验,把「什么真正起作用」说清楚,从而为后续统一建模与迁移学习提供可引用的实验底座,而不是仅仅贡献又一个新的网络名称。

02核心方法

模型采用编码器—解码器 Transformer,在 Colossal Clean Crawled Corpus 上预训练,并以 span corruption 作为主要去噪目标,使模型根据受损输入还原被遮盖的文本片段,从而学习通用的序列到序列表征。

所有下游任务被改写成「输入文本映射到输出文本」的生成格式,分类标签、翻译句对与问答答案等均表现为普通字符串,从而在同一套训练目标与解码接口下完成多任务学习、微调与评估。

03结果与证据

系统消融比较了多种架构选择、预训练目标与数据清洗策略,表明在统一的文本生成框架下,仔细选择去噪目标并配合足够规模的干净语料,能够在一系列迁移基准上取得有竞争力的表现。

对照还显示,任务格式与预训练目标会明显影响归纳偏置;相对于堆叠花哨结构,规模充分、变量控制清楚的消融往往更能说明性能差异来自数据、目标函数还是架构本身。

04影响与意义

T5 为后来的指令微调与 Flan 等工作提供了实验与接口底座,使「用自然语言描述任务、用生成方式给出答案」成为可扩展的默认范式,并推动统一生成接口逐步取代大量专用 NLP 流水线。

把任务格式本身视为归纳偏置的做法,影响了后续多任务与指令数据的设计思路;认真的大规模消融也成为大模型研究中更受重视的证据形式,而不仅是展示单一的最强模型。

05局限

在纯对话与开放式生成场景中,编码器—解码器结构往往不如仅解码器架构来得简洁高效,推理与部署路径也更重,因此后续对话式应用的主流逐渐转向 decoder-only 路线。

大规模网页语料的清洗规则、过滤阈值与复现细节难以完全对齐,不同团队重建同类数据时容易产生偏差;这限制了严格复现,也提醒数据管道本身构成不可忽视的隐藏变量。

06要点

  1. 01任务被写成何种输入输出格式,本身就是一种不可忽视的归纳偏置。
  2. 02认真设计的大规模消融,往往比堆叠花哨结构更能推进对模型行为的理解。
  3. 03统一的生成式接口最终吸收了大多数传统 NLP 流水线中的任务形式。

为何入典

统一接口的一次认真尝试。指令微调和今天的「什么都生成」,都能在 T5 里看到原型。

标签

encoder-decoderpretraining

相关论文

和这篇论文对话

开启对话后,本页的标题、摘要、导读和图注会装进上下文。模型是你自己接入的。

登录后可以接入自己的模型,向这篇论文提问。