经典视觉arXiv:1512.03385
ResNet:让网络真正变深
Deep Residual Learning for Image Recognition
Kaiming He, Xiangyu Zhang, Shaoqing Ren, Jian Sun
CVPR · 2016
220k 引用 · 1.7k 阅读 · 0 收藏
摘要
残差连接让卷积网络可以堆到上百层:每一层只需要学习相对输入的残差。
Residual connections allow convolutional networks to scale to hundreds of layers by learning residual functions with reference to layer inputs.
提要
ResNet 指出深层网络的退化主要来自优化路径而非深度本身,并通过恒等捷径使残差学习可行。该结构让极深网络变得可训练,并成为后来各类架构的默认骨架。
01背景与动机
按理说网络加深应提升表达能力,但实践中常出现退化现象:更深模型反而更难优化,训练误差不降反升,深度带来的潜力难以被真正释放。
本文提出残差学习框架,借助捷径连接改变优化景观,使极深网络重新变得可训练,并在 ImageNet 等设定下展示深度可以被有效利用。
02核心方法
每个残差块学习残差函数并输出 F(x)+x,把恒等映射作为默认通路,从而降低从零拟合完整目标变换的难度,让优化问题更易求解。
反向传播因此拥有近乎畅通的梯度路径,深层信号更容易传递,网络也能更稳定地训练到远超以往的深度。
03结果与证据
论文用更深的残差网络表明:在同类设定下,适当加深不再必然带来训练退化,并且能够提升识别性能,说明深度重新变得可用。
ImageNet 上更深残差模型刷新纪录这一事实,为「捷径改善优化」提供了直接的经验支持,而不仅仅是停留在概念层面的主张。
04影响与意义
残差连接迅速成为现代深度架构的默认骨架,从卷积网络延伸到 Transformer 与扩散模型中的 U-Net 等结构,几乎无处不在。
它把「保证信息与梯度可流动」确立为架构设计的一等原则,深刻塑造了后续几乎所有带 skip connection 的模型。
05局限
捷径并不自动带来对特征层级的深刻理解,网络仍可能过度依赖浅层通路,或保留一定冗余计算,结构本身不能解释全部成功。
要稳定挖掘极深模型,仍需宽度、归一化与正则等要素配合;残差是必要基础,却不是架构设计的全部答案。
06要点
- 01设计深层模型应先保证信息与梯度能够顺畅流动,再追求更强的表达能力。
- 02恒等映射是一种常被低估却极其有效的归纳偏置,能显著改善优化。
- 03理解 ResNet,是理解此后几乎所有带 skip connection 模型的基础。
为何入典
深度可训练性的关键技巧。Transformer 里的残差流,本质上还是这篇论文的思想。
标签
相关论文
ViT:图像也是一串 token
An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale
Transformer:注意力就够了
Attention Is All You Need
AlexNet:深度卷积真正赢了一次
ImageNet Classification with Deep Convolutional Neural Networks
和这篇论文对话
开启对话后,本页的标题、摘要、导读和图注会装进上下文。模型是你自己接入的。