残差块
y=F(x,{Wi})+x——让层去学残差
F(x)=H(x)−x 而非直接映射
H(x)。反向传播时
∂x∂y=1+∂x∂F: 恒等捷径提供一条梯度直通路径, 链式连乘中梯度至少能经“1”这一项无损穿越任意层数, 有效缓解梯度消失(等价于把深层网络变成许多浅层网络的集成)。退化问题(degradation): 56 层 plain 网络的训练误差反而高于 20 层, 且并非过拟合——是恒等映射难以直接学到的优化困难; 残差把目标改写为“把残差学成 0”, 使深层网络在最坏情况下也不劣于浅层, ResNet-152 因此可稳定训练。