经典大模型arXiv:2001.08361
缩放定律:损失随规模平滑下降
Scaling Laws for Neural Language Models
Jared Kaplan, Sam McCandlish, Tom Henighan, Tom B. Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, Dario Amodei
arXiv · 2020
12k 引用 · 1.6k 阅读 · 0 收藏
摘要
用幂律刻画语言模型损失如何随参数量、数据量和算力下降,给「再做大一点」提供了定量依据。
Empirically characterizes how language-modeling loss scales as a power law with model size, dataset size, and compute.
提要
缩放定律表明,在很宽的范围内,预训练损失会随模型、数据与算力规模可预测地下降,而不是突然碰壁。它把大模型预训练从反复试错,推进为可以按预算规划的工程问题。
01背景与动机
在大规模语言模型兴起之前,深度学习实践长期依赖经验调参与个案经验:模型做到多大、数据用多少、算力如何在二者之间分配,往往缺少可外推的定量依据,导致资源分配带有很强的偶然性与不可比性。
这使得大规模预训练更像在黑暗中反复摸索,而不是可以提前规划预算与预期收益的工程过程;不同研究与产业团队也难以用同一套尺度比较投入产出,从而限制了跨项目协作以及长期技术路线图的理性制定。
02核心方法
研究通过系统扫描不同参数量、数据量与训练计算量配置下的 Transformer 语言模型,在尽量受控的条件下记录预训练损失随规模的变化曲线,并据此拟合模型、数据与算力之间的经验幂律关系。
在得到拟合曲线之后,工作进一步外推给定算力预算下的最优模型规模与数据配比,从而把「资源应更多投向更大模型还是更多数据」转化为可计算的分配问题,而不是单纯依赖架构直觉。

03结果与证据
在相当宽的规模区间内,验证损失随模型、数据与算力的增长呈现平滑且可预测的下降趋势,并未观察到突然失效的性能墙壁;同一类幂律形式能够概括多组不同规模实验所呈现的主趋势。
结果还表明,只放大单一维度而忽视其他维度往往难以达到最优;在固定算力约束下,模型大小与训练数据量之间存在可以外推的配置关系,为后来强调算力最优的训练策略提供了经验基础。

04影响与意义
缩放定律随后成为众多大模型项目的投资与排期底层逻辑:先根据可用算力估计可达损失与所需数据规模,再反推模型规格与训练计划,使预训练从高度依赖直觉的艺术,更接近可规划的工程。
它也推动了后续对早期 Kaplan 曲线的修正讨论,例如更强调在给定算力下把模型充分训满、避免过大模型欠训练,并影响了公开研究与工业界关于算力最优配置的共识形成。

05局限
幂律关系本质上是经验规律而非不可动摇的物理定律,其有效范围依赖于数据分布、分词方式、优化器与训练目标等假设;一旦数据质量或结构发生显著变化,曲线形态就可能被改写。
合成数据、领域配比调整以及推理阶段额外投入的计算等因素,都会改变「只靠扩大预训练规模」这一叙事的适用边界;因此外推应被视为有条件的规划工具,而不是可以无限期依赖的保证。

06要点
- 01做大规模预训练时,应先明确算力预算,再讨论架构与训练技巧上的各种花样。
- 02在同等算力下,欠训练的大模型常常表现不如被充分训练的较小模型。
- 03缩放关系的外推在假设成立时非常有用,但任何一个关键假设被打破都可能让原有曲线失效。
为何入典
把炼模型从感觉变成预算问题。Chinchilla、LLaMA 的数据配比,都在回应这篇论文。
标签
相关论文
LLaMA:开放基础模型的分水岭
LLaMA: Open and Efficient Foundation Language Models
DeepSeek-V3:开源 MoE 的新基线
DeepSeek-V3 Technical Report
GPT-3:上下文里的少样本学习
Language Models are Few-Shot Learners
和这篇论文对话
开启对话后,本页的标题、摘要、导读和图注会装进上下文。模型是你自己接入的。