M3-056M3: Deep Learning FoundationsGradient Vanishing & ExplosionMedium
Mastery:
Gradient Vanishing & Explosion: 什么是梯度噪声尺度?它与 batch size 的关系。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 梯度噪声尺度 g=tr(Σ)/|G|² 衡量噪声与信号的比;它随 batch 增大而下降(∝1/B),决定临界 batch。
📌 Key Takeaways
- •噪声尺度 ∝ 1/B,信号不随 B 变(期望不变)
- •临界 batch 即噪声尺度降到 1 时的 B
- •小于临界 batch:加 B 可同步加 lr;大于:收益饱和
📐 Mathematical Derivations
数学机理:设单样本梯度 g_i=G+ξ_i,其中 G 为真实梯度、ξ 为零均值噪声(协方差 Σ)。mini-batch 梯度 Ḡ=(1/B)Σg_i=G+ξ̄,噪声协方差 Σ/B。<strong>梯度噪声尺度</strong>定义为噪声的'总能量'与信号'总能量'之比:g=tr(Σ)/(B‖G‖²)。它的意义是'每步更新中有多大比例来自噪声'。当 g≫1 时更新由噪声主导(训练如同随机游走,但噪声提供正则);当 g≪1 时更新由信号主导(接近确定性梯度下降)。<strong>临界 batch</strong> B_crit 即令 g=1 的 batch:B_crit=tr(Σ)/‖G‖²。<strong>与 lr 缩放的连接</strong>:在 g≫1 的噪声主导区,把 B 放大 k 倍需把 lr 也放大 k 倍才能保持'每步的噪声诱导位移'不变(线性缩放);一旦 B>B_crit(g<1),再放大 B 不会改变'每步的有效位移'(因为已由信号主导),此时只需 sqrt 缩放或不缩放。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>测量方法</strong>——取一批数据,随机分成若干 mini-batch 计算梯度,统计其均值(≈G)与协方差(≈Σ/B);重复多次取平均,即可估计 g 与 B_crit。这是 McCandlish 等 (2018) 'An Empirical Model of Large-Batch Training' 的核心方法。② <strong>实践意义</strong>——B_crit 告诉你'batch 加到多大就没用了':ResNet-50/ImageNet 约 1k~8k;BERT 约 2k~4k;LLM 因 token 级噪声结构不同,B_crit 可达数十万 token。超过 B_crit 后增大 B 只降低噪声(提升隐式正则质量)但不加速,故应用'更大 batch + 更多正则'或'更大 lr + 更多步'的取舍。③ <strong>噪声作为资源</strong>——梯度噪声不是纯粹的坏事:它提供隐式正则(偏好平坦解)与探索能力;把噪声降到 0(超大 batch)反而可能泛化变差。④ <strong>与 warmup/裁剪的联动</strong>——噪声尺度大的早期需要更长 warmup 与更积极的裁剪。⑤ <strong>与自适应优化器的交互</strong>——Adam 的 √v̂ 归一化会改变'有效噪声尺度':它把噪声也归一化,故 Adam 下的最优 batch 与 SGD 不同。⑥ <strong>面试要点</strong>——若被问'batch size 该设多大',答'先估临界 batch,在其附近取最优;超过则收益递减',并说明噪声的隐式正则价值。
⚠️ Common Interview Pitfalls
- ✕认为 batch 越大越好(超过临界 batch 收益饱和)
- ✕忽略噪声的隐式正则作用(一味追求低噪声)
🎯 Interviewer Follow-ups
- ?梯度噪声尺度如何实测?
- ?为什么噪声尺度小说明'训练已接近确定性'?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.