探索/大模型

经典大模型arXiv:2001.08361

缩放定律:损失随规模平滑下降

Scaling Laws for Neural Language Models

Jared Kaplan, Sam McCandlish, Tom Henighan, Tom B. Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, Dario Amodei

arXiv · 2020

12k 引用 · 1.6k 阅读 · 0 收藏

摘要

用幂律刻画语言模型损失如何随参数量、数据量和算力下降,给「再做大一点」提供了定量依据。

Empirically characterizes how language-modeling loss scales as a power law with model size, dataset size, and compute.

提要

缩放定律表明,在很宽的范围内,预训练损失会随模型、数据与算力规模可预测地下降,而不是突然碰壁。它把大模型预训练从反复试错,推进为可以按预算规划的工程问题。

01背景与动机

在大规模语言模型兴起之前,深度学习实践长期依赖经验调参与个案经验:模型做到多大、数据用多少、算力如何在二者之间分配,往往缺少可外推的定量依据,导致资源分配带有很强的偶然性与不可比性。

这使得大规模预训练更像在黑暗中反复摸索,而不是可以提前规划预算与预期收益的工程过程;不同研究与产业团队也难以用同一套尺度比较投入产出,从而限制了跨项目协作以及长期技术路线图的理性制定。

02核心方法

研究通过系统扫描不同参数量、数据量与训练计算量配置下的 Transformer 语言模型,在尽量受控的条件下记录预训练损失随规模的变化曲线,并据此拟合模型、数据与算力之间的经验幂律关系。

在得到拟合曲线之后,工作进一步外推给定算力预算下的最优模型规模与数据配比,从而把「资源应更多投向更大模型还是更多数据」转化为可计算的分配问题,而不是单纯依赖架构直觉。

一系列语言模型训练曲线,模型规模从10³到10⁹参数(不含嵌入)
1. 一系列语言模型训练曲线,模型规模从10³到10⁹参数(不含嵌入)

03结果与证据

在相当宽的规模区间内,验证损失随模型、数据与算力的增长呈现平滑且可预测的下降趋势,并未观察到突然失效的性能墙壁;同一类幂律形式能够概括多组不同规模实验所呈现的主趋势。

结果还表明,只放大单一维度而忽视其他维度往往难以达到最优;在固定算力约束下,模型大小与训练数据量之间存在可以外推的配置关系,为后来强调算力最优的训练策略提供了经验基础。

左:早停测试损失 L(N,D) 按式(1.5)随数据量 D 与模型规模 N 可预测变化。右:初始瞬态后,各规模 N 的学习曲线可用式(1.6)拟合,该式以大批量下的步数 S_min 参数化(详见第5.1节)
2. 左:早停测试损失 L(N,D) 按式(1.5)随数据量 D 与模型规模 N 可预测变化。右:初始瞬态后,各规模 N 的学习曲线可用式(1.6)拟合,该式以大批量下的步数 S_min 参数化(详见第5.1节)

04影响与意义

缩放定律随后成为众多大模型项目的投资与排期底层逻辑:先根据可用算力估计可达损失与所需数据规模,再反推模型规格与训练计划,使预训练从高度依赖直觉的艺术,更接近可规划的工程。

它也推动了后续对早期 Kaplan 曲线的修正讨论,例如更强调在给定算力下把模型充分训满、避免过大模型欠训练,并影响了公开研究与工业界关于算力最优配置的共识形成。

固定总计算量或训练步数时,性能遵循式(5.6)的 L(N,S)。每一计算预算对应使性能最优的模型规模。小 S 处拟合一般并不意外,因学习曲线幂律在训练极早期即失效
3. 固定总计算量或训练步数时,性能遵循式(5.6)的 L(N,S)。每一计算预算对应使性能最优的模型规模。小 S 处拟合一般并不意外,因学习曲线幂律在训练极早期即失效

05局限

幂律关系本质上是经验规律而非不可动摇的物理定律,其有效范围依赖于数据分布、分词方式、优化器与训练目标等假设;一旦数据质量或结构发生显著变化,曲线形态就可能被改写。

合成数据、领域配比调整以及推理阶段额外投入的计算等因素,都会改变「只靠扩大预训练规模」这一叙事的适用边界;因此外推应被视为有条件的规划工具,而不是可以无限期依赖的保证。

左:将早停步数刻画为过拟合程度的函数;红线为第5.3节导出的早停下界。右:在不同大小数据子样本上训练的一系列3亿参数模型的训练与测试损失;测试损失通常先跟随无限数据运行后偏离。相对无限数据极限的过拟合程度会被 L_test−L_train 显著高估(黑条)
4. 左:将早停步数刻画为过拟合程度的函数;红线为第5.3节导出的早停下界。右:在不同大小数据子样本上训练的一系列3亿参数模型的训练与测试损失;测试损失通常先跟随无限数据运行后偏离。相对无限数据极限的过拟合程度会被 L_test−L_train 显著高估(黑条)

06要点

  1. 01做大规模预训练时,应先明确算力预算,再讨论架构与训练技巧上的各种花样。
  2. 02在同等算力下,欠训练的大模型常常表现不如被充分训练的较小模型。
  3. 03缩放关系的外推在假设成立时非常有用,但任何一个关键假设被打破都可能让原有曲线失效。

为何入典

把炼模型从感觉变成预算问题。Chinchilla、LLaMA 的数据配比,都在回应这篇论文。

标签

scalingcompute

相关论文

和这篇论文对话

开启对话后,本页的标题、摘要、导读和图注会装进上下文。模型是你自己接入的。

登录后可以接入自己的模型,向这篇论文提问。