返回 深度学习 思维导图
中文·English
🧠 深度学习ID: vanishing-exploding

梯度消失/爆炸

Vanishing/Exploding Gradients
🎯核心定义
梯度消失/爆炸是深度网络与 RNN 训练的核心障碍,根源是反向传播沿深度的 Jacobian 连乘: Lh0=t=1Ththt1\frac{\partial L}{\partial h_0}=\prod_{t=1}^{T}\frac{\partial h_t}{\partial h_{t-1}},其范数上界满足 tJtγT\prod_{t}\Vert J_t\Vert\le\gamma^T——每层谱范数 γ<1\gamma<1 时随深度指数衰减到 0(梯度消失),γ>1\gamma>1 时指数爆炸。数值直觉: 每步缩放 0.90.9,连乘 50 步后 0.9500.0050.9^{50}\approx0.005,梯度缩至约 1/200;每步 1.11.11.1501171.1^{50}\approx117,直接溢出。Sigmoid 导数峰值 0.25(<1)是典型的“消失放大器”。缓解手段: ① 权重初始化——Xavier 保持前/后向方差 2nin+nout\frac{2}{n_{in}+n_{out}},Kaiming 针对 ReLU 修正为 2nin\frac{2}{n_{in}};② 残差连接 y=F(x)+xy=F(x)+x 提供梯度直通的恒等捷径;③ 归一化 BN/LN/RMSNorm 稳定激活尺度;④ ReLU 族正区间导数恒 1;⑤ 梯度裁剪兜底爆炸,LSTM 以加性细胞状态缓解 RNN 长依赖。
💡使用场景
面试必考“为什么深层网络训不动?”、“RNN 为什么难学长依赖?”、“0.9500.0050.9^{50}\approx0.005 说明什么?”;常要求串联解释 ResNet 残差、Xavier/Kaiming 初始化、BatchNorm 各自缓解梯度消失的机制,以及它们为何缺一不可。
解决的核心痛点
让数百层网络(ResNet-152、大模型)真正可训练——残差连接使梯度可经恒等捷径无损耗直通,有效深度变浅、可训练深度变深;初始化把每层输出方差锚定在输入量级,使连乘范数接近 γ1\gamma\approx1;归一化稳定每层激活与 Jacobian 尺度。三者配合下,朴素堆叠 20 层即出现的退化(训练误差不降反升)被打破,网络可扩展到 1000+ 层,RNN 的长期依赖窗口也从几步扩展到数十步。
🎯5 个高频面试考点 (Exam Points)
1
用连乘机制 tJtγT\prod_{t}\Vert J_t\Vert\le\gamma^T 解释梯度消失/爆炸,并给出数字例子 0.9500.0050.9^{50}\approx0.005 说明什么?
2
为什么 RNN 比 CNN 更易梯度消失?LSTM 细胞状态的加性路径如何缓解?
3
Xavier 与 Kaiming 初始化分别保持什么方差?为什么 ReLU 下 Kaiming 要乘以 2?
4
残差连接 y=F(x)+xy=F(x)+x 为什么能缓解梯度消失?“恒等捷径梯度直通”的具体含义?
5
除初始化与残差外还有哪些缓解手段(归一化/ReLU 族/梯度裁剪/LSTM 门控)?各自机制?
更新于 2026-08-12
🎯
检验攻克程度:针对「梯度消失/爆炸」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点激活函数演进下一个知识点损失函数族

🔗 更多 深度学习 知识点卡片

Adam/AdamWAutograd 动态图BatchNorm 批归一化经典 CNN 演进