经典大模型arXiv:1910.10683
T5:所有 NLP 都是文本生成
Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer
Colin Raffel, Noam Shazeer, Adam Roberts, Katherine Lee, Sharan Narang, Michael Matena, Yanqi Zhou, Wei Li, Peter J. Liu
JMLR · 2020
28k 引用 · 1.5k 阅读 · 0 收藏
摘要
把所有 NLP 任务写成「文本进、文本出」,并系统比较预训练目标、数据和规模的影响。
Casts every NLP problem as text-to-text generation and systematically studies pretraining objectives, data, and scale.
提要
T5 把分类、翻译、摘要与问答等任务统一成同一种文本到文本的生成问题。它以大规模对照实验厘清预训练目标、架构与数据的影响,而不是只发布一个更强的模型。
01背景与动机
此前自然语言处理常为不同任务设计不同架构与损失函数,流水线碎片化严重;同时许多工作只公布最终模型,缺少在统一设定下比较目标函数、架构与数据的系统对照,难以判断增益究竟来自何处。
T5 的动机是提供一份超大规模、设定清晰的预训练对照实验,把「什么真正起作用」说清楚,从而为后续统一建模与迁移学习提供可引用的实验底座,而不是仅仅贡献又一个新的网络名称。
02核心方法
模型采用编码器—解码器 Transformer,在 Colossal Clean Crawled Corpus 上预训练,并以 span corruption 作为主要去噪目标,使模型根据受损输入还原被遮盖的文本片段,从而学习通用的序列到序列表征。
所有下游任务被改写成「输入文本映射到输出文本」的生成格式,分类标签、翻译句对与问答答案等均表现为普通字符串,从而在同一套训练目标与解码接口下完成多任务学习、微调与评估。
03结果与证据
系统消融比较了多种架构选择、预训练目标与数据清洗策略,表明在统一的文本生成框架下,仔细选择去噪目标并配合足够规模的干净语料,能够在一系列迁移基准上取得有竞争力的表现。
对照还显示,任务格式与预训练目标会明显影响归纳偏置;相对于堆叠花哨结构,规模充分、变量控制清楚的消融往往更能说明性能差异来自数据、目标函数还是架构本身。
04影响与意义
T5 为后来的指令微调与 Flan 等工作提供了实验与接口底座,使「用自然语言描述任务、用生成方式给出答案」成为可扩展的默认范式,并推动统一生成接口逐步取代大量专用 NLP 流水线。
把任务格式本身视为归纳偏置的做法,影响了后续多任务与指令数据的设计思路;认真的大规模消融也成为大模型研究中更受重视的证据形式,而不仅是展示单一的最强模型。
05局限
在纯对话与开放式生成场景中,编码器—解码器结构往往不如仅解码器架构来得简洁高效,推理与部署路径也更重,因此后续对话式应用的主流逐渐转向 decoder-only 路线。
大规模网页语料的清洗规则、过滤阈值与复现细节难以完全对齐,不同团队重建同类数据时容易产生偏差;这限制了严格复现,也提醒数据管道本身构成不可忽视的隐藏变量。
06要点
- 01任务被写成何种输入输出格式,本身就是一种不可忽视的归纳偏置。
- 02认真设计的大规模消融,往往比堆叠花哨结构更能推进对模型行为的理解。
- 03统一的生成式接口最终吸收了大多数传统 NLP 流水线中的任务形式。
为何入典
统一接口的一次认真尝试。指令微调和今天的「什么都生成」,都能在 T5 里看到原型。
标签
相关论文
BERT:双向预训练改变 NLP
BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding
InstructGPT:让模型听人话
Training language models to follow instructions with human feedback
GPT-3:上下文里的少样本学习
Language Models are Few-Shot Learners
和这篇论文对话
开启对话后,本页的标题、摘要、导读和图注会装进上下文。模型是你自己接入的。