梯度爆炸排查与 NaN 损失根因定位体系 (Gradient Clipping & NaN Loss Root-Cause Debugging) 是深度学习与大模型训练中诊断并修复训练发散与崩溃的核心工程方法论;当反向传播中梯度连乘值急剧膨胀时,会导致权重更新步长巨大(步入非凸超平面的险峻陡坡),引发激活值溢出并在下一个 Epoch 直接崩出 `Loss = NaN`;标准两级防御与诊断流水线:1) 梯度裁剪 (Gradient Clipping by Global Norm: 当全模型梯度
L2 范数
∣g∣2>max_norm 时,按比例缩小为
g←g⋅∥g∥2max_norm,保留梯度原始几何方向);2) 混合精度与下溢排查:FP16 动态损失缩放 (Dynamic Loss Scaling: 乘缩放因子
S=216 将小梯度移入可表示区间,遇 Inf/NaN 则跳过该步并减小
S);3) 异常算子定位:使用 `torch.autograd.set_detect_anomaly(True)` 与 Hook 捕获第一个输出 NaN 的层。