梯度消失/爆炸是深度网络与 RNN 训练的核心障碍,根源是反向传播沿深度的 Jacobian 连乘:
∂h0∂L=∏t=1T∂ht−1∂ht,其范数上界满足
∏t∥Jt∥≤γT——每层谱范数
γ<1 时随深度指数衰减到 0(梯度消失),
γ>1 时指数爆炸。数值直觉: 每步缩放
0.9,连乘 50 步后
0.950≈0.005,梯度缩至约 1/200;每步
1.1 则
1.150≈117,直接溢出。Sigmoid 导数峰值 0.25(<1)是典型的“消失放大器”。缓解手段: ① 权重初始化——Xavier 保持前/后向方差
nin+nout2,Kaiming 针对 ReLU 修正为
nin2;② 残差连接
y=F(x)+x 提供梯度直通的恒等捷径;③ 归一化 BN/LN/RMSNorm 稳定激活尺度;④ ReLU 族正区间导数恒 1;⑤ 梯度裁剪兜底爆炸,LSTM 以加性细胞状态缓解 RNN 长依赖。