经典大模型arXiv:1810.04805
BERT:双向预训练改变 NLP
BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding
Jacob Devlin, Ming-Wei Chang, Kenton Lee, Kristina Toutanova
NAACL · 2019
110k 引用 · 1.7k 阅读 · 0 收藏
摘要
用掩码语言模型与下一句预测做双向预训练,再在下游任务上微调,一举刷新 GLUE 等理解基准。
Pretrains a bidirectional Transformer with masked language modeling and next-sentence prediction, then fine-tunes for downstream NLP tasks.
提要
BERT 证明双向上下文预训练可以把一个编码器变成多数理解任务的通用底座。它用掩码语言建模弥补单向预训练的不足,并确立了先预训练再微调的主流流程。
01背景与动机
在BERT提出之前,大规模预训练多以GPT式从左到右的单向语言模型为主。这类目标天然契合文本生成,却难以在分类、抽取等理解任务中同时利用词语左右两侧的完整语境,因而限制了编码器作为通用底座的潜力。
作者因此转向双向上下文建模,希望用同一套预训练编码器覆盖尽可能多的下游理解任务。其动机是:若预训练阶段已能看到完整上下文,微调时往往只需少量标注与轻量输出层,即可把通用表示迁移到具体应用。
02核心方法
核心预训练任务是掩码语言模型:随机选取约百分之十五的词元加以掩码,并要求模型依据双向上下文还原被遮盖内容。与从左到右的生成式目标不同,这一设定迫使每个位置融合左右信息,从而得到深度双向的表示。
此外还加入下一句预测任务,判断两个句子在原文中是否相邻,借此增强对句间关系与篇章连贯性的建模能力。下游使用时通常对整网微调,并在顶层接上任务相关的简单分类或跨度预测头,无需为每个任务重新设计复杂结构。
03结果与证据
在多项自然语言理解基准上,BERT相对此前的单向或浅层双向方法取得了稳定提升,尤其在问答、自然语言推断和命名实体识别等需要细粒度上下文的任务中表现突出。这些结果说明双向上下文预训练能够显著改善通用文本表示质量。
论文还通过消融实验比较不同掩码策略与下一句预测等设计选择,表明掩码语言模型是性能增益的主要来源,而句级任务的贡献相对有限。整体证据支持“深度双向预训练加任务微调”这一流程,而不是依赖为每项任务定制的复杂架构。
04影响与意义
BERT迅速成为工业界搜索、文本分类、信息抽取等系统的标准起点,许多产品线在数年内被BERT系微调模型重写。它把“先大规模预训练、再小数据微调”固化为默认工作流,降低了定制理解模型的门槛。
后续工作如RoBERTa、SpanBERT等在训练策略与目标上对其修正与延伸,形成庞大的编码器家族。即便后来生成式大模型兴起,BERT所确立的双向编码与迁移微调思路仍在检索、重排序和结构化预测中广泛沿用。
05局限
掩码语言模型与自回归生成目标并不统一,因此BERT类编码器难以直接胜任开放式文本生成与条件续写。下一句预测后来被多篇跟进工作证明信号较弱,甚至可能引入不必要的噪声,说明原始训练配方仍有明显简化空间。
随着规模更大的生成式语言模型普及,许多原先依赖独立编码器微调的任务逐渐改由上下文提示或指令跟随方式完成。BERT因此更适合继续充当理解与表示模块,而不是被视作覆盖全部语言智能形态的唯一范式。
06要点
- 01理解类任务更依赖双向上下文,而生成类任务通常更契合单向自回归建模。
- 02预训练目标的选择往往比局部架构改动更能决定迁移效果的上限。
- 03“先预训练再微调”因BERT而成为自然语言处理中的默认工作流程。
为何入典
「预训练 + 微调」成为范式。它让 NLP 从任务专用模型转向通用编码器。
标签
相关论文
T5:所有 NLP 都是文本生成
Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer
RAG:先检索,再生成
Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks
GPT-3:上下文里的少样本学习
Language Models are Few-Shot Learners
Transformer:注意力就够了
Attention Is All You Need
和这篇论文对话
开启对话后,本页的标题、摘要、导读和图注会装进上下文。模型是你自己接入的。