探索/大模型

经典大模型arXiv:2005.14165

GPT-3:上下文里的少样本学习

Language Models are Few-Shot Learners

Tom B. Brown, Benjamin Mann, Nick Ryder, Melanie Subbiah, Jared Kaplan, Prafulla Dhariwal, Arvind Neelakantan, Pranav Shyam, Girish Sastry, Amanda Askell, Sandhini Agarwal, Ariel Herbert-Voss, Gretchen Krueger, Tom Henighan, Rewon Child, Aditya Ramesh, Daniel M. Ziegler, Jeffrey Wu, Clemens Winter, Christopher Hesse, Mark Chen, Eric Sigler, Mateusz Litwin, Scott Gray, Benjamin Chess, Jack Clark, Christopher Berner, Sam McCandlish, Alec Radford, Ilya Sutskever, Dario Amodei

NeurIPS · 2020

38k 引用 · 1.7k 阅读 · 0 收藏

摘要

把自回归语言模型做到 1750 亿参数后,仅靠提示中的示例就能完成新任务,不必为每个任务微调。

Shows that scaling autoregressive language models to 175B parameters enables few-shot generalization from prompts without task-specific fine-tuning.

提要

GPT-3 把模型规模转化为可迁移的能力,使同一套语言模型能在上下文中表现少样本学习。任务适应不必总是更新参数,而更多转向提示与示例设计。

01背景与动机

此前大模型多通过针对下游任务的微调来适应新场景,这一路径虽然有效,但高度依赖标注数据与专门的训练和部署流程。研究界开始关注一个更彻底的问题:当模型足够大时,是否仅凭上下文中的指令和示例就能切换任务,而无需任何梯度更新。

GPT-3的核心动机是系统检验规模扩张能否稳定带来所谓的上下文学习能力,从而把任务适应的重心从修改参数转移到设计提示。若这一假设成立,单一语言模型就有望以统一接口服务众多应用,显著降低为每项任务单独微调与维护的成本。

02核心方法

模型采用仅解码器的Transformer结构,在大规模文本语料上以自回归语言建模为目标进行训练,即根据已有上文预测下一个词元。结构选择与GPT系列一脉相承,重点并不在提出新架构,而在于参数量、数据规模与训练计算的同步放大。

评估阶段不更新权重,而是在输入中写入任务说明与零个、一个或多个示例,然后让模型续写答案。通过比较零样本、一样本与少样本设定,观察上下文学习是否随规模增强,并覆盖翻译、问答、推理等多类任务。

语言模型元学习。无监督预训练使模型获得广泛技能与模式识别能力,推理时据此快速适应或识别目标任务。“上下文学习”指该过程在每次前向传播中的内循环。图中序列不代表预训练数据,仅说明单序列中有时嵌有重复子任务
1. 语言模型元学习。无监督预训练使模型获得广泛技能与模式识别能力,推理时据此快速适应或识别目标任务。“上下文学习”指该过程在每次前向传播中的内循环。图中序列不代表预训练数据,仅说明单序列中有时嵌有重复子任务

03结果与证据

实验表明,随着参数规模增大,模型在仅给定自然语言指令和少量示例时的表现整体上升,部分任务上少样本结果接近甚至匹配专门微调的较小模型。这为“规模带来新的任务适应方式”提供了经验支持,而非只是旧有监督曲线的平滑延伸。

与此同时,不同任务上的增益并不均匀,有的能力显现较早,有的仍明显落后于微调基线。证据既展示了上下文学习的潜力,也说明它并不能在所有理解与推理场景中单凭规模就取代细致的任务训练。

更大模型能更高效利用上下文信息。在去除词中随机符号的简单任务上,展示有/无自然语言任务描述时的上下文学习性能(见第3.9.2节)。大模型更陡的“上下文学习曲线”表明其从上下文学习任务的能力更强;多类任务上行为定性相似
2. 更大模型能更高效利用上下文信息。在去除词中随机符号的简单任务上,展示有/无自然语言任务描述时的上下文学习性能(见第3.9.2节)。大模型更陡的“上下文学习曲线”表明其从上下文学习任务的能力更强;多类任务上行为定性相似

04影响与意义

GPT-3把提示工程与上下文示例设计推到研究与应用的舞台中央,并间接催生了智能体、工具调用以及对话式产品等完整链条。产业界开始把通用大模型当作可复用的能力层,而不是为每个应用从零训练和部署专用系统。

它也重新定义了“模型即接口”的产品预期:用户尽量通过自然语言描述任务与约束来驱动模型行为。后续的指令微调、人类反馈对齐以及工具使用等研究,很大程度上都建立在GPT-3所展示的规模化上下文学习前提之上。

全部42个准确率类基准的总体性能。零样本随模型增大稳步提升,少样本提升更快,说明大模型更擅长上下文学习。SuperGLUE 详细分析见图3.8
3. 全部42个准确率类基准的总体性能。零样本随模型增大稳步提升,少样本提升更快,说明大模型更擅长上下文学习。SuperGLUE 详细分析见图3.8

05局限

原始GPT-3的训练与推理成本高昂,并且主要以封闭接口形式对外提供,独立复现与细粒度机制分析都受到明显限制。模型输出仍普遍存在事实性错误与幻觉,在需要可靠知识或精确推理的场景中不能单独当作可信来源。

更关键的是,未经过对齐的基座模型往往难以稳定遵循用户意图,在可用性、拒答与安全性方面都显得不足。真正面向产品的行为改善,要等到InstructGPT等基于人类反馈的指令微调工作出现之后才变得较为明显。

零样本、单样本与少样本,并与传统微调对比。上图为用语言模型完成任务的四种方式:微调为传统方法;本文研究的零/单/少样本仅需测试时前向传播。少样本通常提供数十个示例。任务描述、示例与提示原文见附录G
4. 零样本、单样本与少样本,并与传统微调对比。上图为用语言模型完成任务的四种方式:微调为传统方法;本文研究的零/单/少样本仅需测试时前向传播。少样本通常提供数十个示例。任务描述、示例与提示原文见附录G

06要点

  1. 01足够的规模可以涌现出上下文学习这一新的使用方式,而不仅仅是旧指标上的平滑提升。
  2. 02把示例直接写进提示,相当于在不改动权重的前提下完成一次临时的任务适应。
  3. 03模型具备完成任务的能力,并不自动等于它会默认遵守人的意图与安全约束。

为何入典

它把「提示」变成接口。从此模型不只是分类器,而是可编程的文本机器。

标签

LLMin-context learning

相关论文

和这篇论文对话

开启对话后,本页的标题、摘要、导读和图注会装进上下文。模型是你自己接入的。

登录后可以接入自己的模型,向这篇论文提问。