经典优化arXiv:1412.6980
Adam:几乎每个人都在用的优化器
Adam: A Method for Stochastic Optimization
Diederik P. Kingma, Jimmy Ba
ICLR · 2015
180k 引用 · 1.6k 阅读 · 0 收藏
摘要
把动量与自适应学习率合为一体,成为深度网络训练中最常用的默认优化器。
Adam combines RMSProp-style adaptive learning rates with momentum, offering a robust default optimizer for deep networks.
提要
Adam 把一阶动量与二阶量级估计写入同一更新规则,使大多数深度模型更容易开箱训练。它显著降低了学习率手调负担,并成为跨架构的常用默认优化器。
01背景与动机
随机梯度下降及其动量变体对学习率、噪声尺度和稀疏梯度往往敏感,不同参数坐标需要的步长并不相同。实践中大量时间花在网格搜索上,阻碍了快速试验新结构。
研究者希望用自适应矩估计自动调节每维有效步长,并在初期偏差较大时提供修正,从而在不牺牲稳定性的前提下减轻调参负担。这就是 Adam 要回答的工程与算法问题。
02核心方法
算法维护梯度的指数滑动均值作为一阶动量,同时维护梯度平方的指数滑动均值估计二阶量级,再用二者之比形成坐标相关的更新。偏差修正抵消冷启动阶段矩估计偏小的问题。
该规则把“方向平滑”与“按量级缩放”结合进同一步,使稀疏或尺度差异大的参数也能共用更宽泛的全局学习率。实现简单,与常见反向传播框架兼容。
03结果与证据
原工作在多种机器学习与深度学习任务上展示了稳定收敛与较少的学习率敏感度,说明自适应矩在实践中能够替代大量手工日程表。证据以训练曲线与跨任务可用性为主,而非单一刷榜数字。
后续社区经验进一步表明,从卷积网络到序列模型,Adam 类更新常常能在默认超参附近启动训练。真正的对比优势体现在易用性与鲁棒性,而不是在每个基准上都必然最高精度。
04影响与意义
Adam 及其修正版 AdamW 几乎成为 CNN、Transformer 与扩散模型训练的默认选项,塑造了现代深度学习的标准工具链。许多论文与代码库以它为基线优化器。
它也改变了人们阅读训练曲线的方式:自适应步长会掩盖或放大某些损失形态,促使研究者更谨慎地比较优化器与正则配置。正确的解耦权重衰减(AdamW)进一步巩固了这一地位。
05局限
在部分视觉任务上,精心调参的 SGD 动量仍可能获得更好泛化;自适应方法并非免费午餐。面对非平稳目标、极端大 batch 或特殊噪声结构时,仍需调整 β、学习率与预热。
原始 Adam 与 L2 正则的耦合方式并不等价于真正的权重衰减,直到 AdamW 才把这一点做对。理解这些细节,比不断追逐“新优化器”名号更重要。
06要点
- 01自适应步长能降低调参成本,但不会自动保证更好的泛化表现。
- 02应先掌握 AdamW 与解耦权重衰减,再评估是否值得换用更新的优化器。
- 03优化器选择会改变可见的训练动态,因此比较模型时必须控制优化配置。
为何入典
训练基础设施。读懂 Adam,才能理解后续的学习率、权重衰减和自适应优化争论。
标签
相关论文
FlashAttention:把注意力写成 IO 感知算法
FlashAttention: Fast and Memory-Efficient Exact Attention
Transformer:注意力就够了
Attention Is All You Need
和这篇论文对话
开启对话后,本页的标题、摘要、导读和图注会装进上下文。模型是你自己接入的。