探索/视觉

经典视觉arXiv:1512.03385

ResNet:让网络真正变深

Deep Residual Learning for Image Recognition

Kaiming He, Xiangyu Zhang, Shaoqing Ren, Jian Sun

CVPR · 2016

220k 引用 · 1.7k 阅读 · 0 收藏

摘要

残差连接让卷积网络可以堆到上百层:每一层只需要学习相对输入的残差。

Residual connections allow convolutional networks to scale to hundreds of layers by learning residual functions with reference to layer inputs.

提要

ResNet 指出深层网络的退化主要来自优化路径而非深度本身,并通过恒等捷径使残差学习可行。该结构让极深网络变得可训练,并成为后来各类架构的默认骨架。

01背景与动机

按理说网络加深应提升表达能力,但实践中常出现退化现象:更深模型反而更难优化,训练误差不降反升,深度带来的潜力难以被真正释放。

本文提出残差学习框架,借助捷径连接改变优化景观,使极深网络重新变得可训练,并在 ImageNet 等设定下展示深度可以被有效利用。

02核心方法

每个残差块学习残差函数并输出 F(x)+x,把恒等映射作为默认通路,从而降低从零拟合完整目标变换的难度,让优化问题更易求解。

反向传播因此拥有近乎畅通的梯度路径,深层信号更容易传递,网络也能更稳定地训练到远超以往的深度。

03结果与证据

论文用更深的残差网络表明:在同类设定下,适当加深不再必然带来训练退化,并且能够提升识别性能,说明深度重新变得可用。

ImageNet 上更深残差模型刷新纪录这一事实,为「捷径改善优化」提供了直接的经验支持,而不仅仅是停留在概念层面的主张。

04影响与意义

残差连接迅速成为现代深度架构的默认骨架,从卷积网络延伸到 Transformer 与扩散模型中的 U-Net 等结构,几乎无处不在。

它把「保证信息与梯度可流动」确立为架构设计的一等原则,深刻塑造了后续几乎所有带 skip connection 的模型。

05局限

捷径并不自动带来对特征层级的深刻理解,网络仍可能过度依赖浅层通路,或保留一定冗余计算,结构本身不能解释全部成功。

要稳定挖掘极深模型,仍需宽度、归一化与正则等要素配合;残差是必要基础,却不是架构设计的全部答案。

06要点

  1. 01设计深层模型应先保证信息与梯度能够顺畅流动,再追求更强的表达能力。
  2. 02恒等映射是一种常被低估却极其有效的归纳偏置,能显著改善优化。
  3. 03理解 ResNet,是理解此后几乎所有带 skip connection 模型的基础。

为何入典

深度可训练性的关键技巧。Transformer 里的残差流,本质上还是这篇论文的思想。

标签

CNNarchitecture

相关论文

和这篇论文对话

开启对话后,本页的标题、摘要、导读和图注会装进上下文。模型是你自己接入的。

登录后可以接入自己的模型,向这篇论文提问。