返回 深度学习 思维导图
中文·English
🧠 深度学习ID: resnet-skip

ResNet 残差连接

ResNet Skip Connections
🎯核心定义
残差块 y=F(x,{Wi})+xy = F(x, \{W_i\}) + x——让层去学残差 F(x)=H(x)xF(x) = \mathcal{H}(x) - x 而非直接映射 H(x)\mathcal{H}(x)。反向传播时 yx=1+Fx\frac{\partial y}{\partial x} = 1 + \frac{\partial F}{\partial x}: 恒等捷径提供一条梯度直通路径, 链式连乘中梯度至少能经“1”这一项无损穿越任意层数, 有效缓解梯度消失(等价于把深层网络变成许多浅层网络的集成)。退化问题(degradation): 56 层 plain 网络的训练误差反而高于 20 层, 且并非过拟合——是恒等映射难以直接学到的优化困难; 残差把目标改写为“把残差学成 0”, 使深层网络在最坏情况下也不劣于浅层, ResNet-152 因此可稳定训练。
💡使用场景
几乎所有深层 CNN/Transformer(Pre-Norm 亦同思路)的标准组件; 面试高频——“退化问题是什么”“为什么残差让上千层网络可训”“捷径为什么必须是恒等”。
解决的核心痛点
深度超过阈值后的优化退化与梯度消失——有了恒等捷径, 精度随深度单调提升不再有上限障碍, ImageNet top-5 错误率从 VGG 的 ~7.3% 降到 ResNet-152 的 ~4.6%, 152 层模型成为此后所有视觉骨干的默认起点。
🎯5 个高频面试考点 (Exam Points)
1
推导残差块梯度 yx=1+Fx\frac{\partial y}{\partial x} = 1 + \frac{\partial F}{\partial x}, 解释恒等捷径为什么能缓解梯度消失。
2
退化问题(degradation)是什么? 为什么 56 层比 20 层训练误差更高却并非过拟合?
3
为什么捷径必须是恒等映射 xx 而不是可学习的变换(如 1×1 卷积)?
4
残差块输出维度不匹配时(F 改变通道数/分辨率), 有哪些处理方式? 各有什么代价?
5
ResNet 如何让训练 152 层甚至上千层网络成为可能? 从优化与梯度两个角度回答。
📖 关联深度指南:📄 cnn-and-vit-architectures
更新于 2026-08-12
🎯
检验攻克程度:针对「ResNet 残差连接」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点经典 CNN 演进下一个知识点深度可分离卷积

🔗 更多 深度学习 知识点卡片

激活函数演进Adam/AdamWAutograd 动态图BatchNorm 批归一化