M3-026M3: Deep Learning FoundationsNormalization TechniquesHard
Mastery:
Normalization Techniques: 解释 Weight Standardization 与它在无 BN 网络中的作用。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 对权重矩阵做零均值单位方差标准化;改善优化条件,可与 GN 组合替代 BN。
📌 Key Takeaways
- •归一化的是权重(而非激活)
- •使权重的 Lipschitz 常数受控
📐 Mathematical Derivations
机制:Weight Standardization 对<strong>卷积核(权重)</strong> 做标准化——对每个输出通道的卷积核(跨输入通道与核空间)计算均值与方差,标准化后再做卷积:Ŵ=(W−μ_W)/σ_W。<strong>与 BN 的对比</strong>:BN 归一化<strong>激活</strong>(y 的统计量),WS 归一化<strong>权重</strong>(W 的统计量)。<strong>为什么 WS 能替代 BN</strong>:(a) BN 的效果部分来自'使激活的方差受控',而激活方差 = 权重范数 × 输入方差——故控制权重范数也能达到类似效果;(b) 标准化后的权重使每层的<strong>Lipschitz 常数受控</strong>(‖Ŵ‖₂ 有界),改善梯度传播与优化条件;(c) 更重要的是,WS 的统计量<strong>只依赖权重</strong>(与 batch 无关),故 batch=1 时仍有效。<strong>与 GN 的组合</strong>:论文(Qiao et al. 2019)发现 <strong>WS + GN</strong> 在小 batch 检测上显著优于 GN 单独使用,甚至优于 BN(大 batch 时);因为 GN 控制激活的分布、WS 控制权重的尺度,两者互补。<strong>其他好处</strong>:WS 使权重矩阵的行零均值单位方差,可能改善'权重衰减'的效果(因为衰减对各行的影响一致),并使超参(如学习率)对尺度不敏感。
🏭 Production Trade-offs
实践要点:① <strong>与 BN 的差异</strong>——WS 不能替代 BN 的'内部协变量偏移'缓解效果(BN 归一化激活的分布,WS 只控制权重的尺度);故 WS 通常需配合 GN 或 LN 使用,单独用 WS 的效果有限。② <strong>计算成本</strong>——WS 的标准化开销相对卷积很小(权重的元素数远少于激活),但会阻止某些算子融合(如把 BN 折进卷积的优化);故在推理时 WS 可能不如 BN 高效。③ <strong>与其他权重归一化的关系</strong>——<strong>Weight Normalization</strong>(Salimans & Kingma)用 w=g·v/‖v‖(方向与幅度解耦),WS 是它的简化版(标准化而非解耦);两者目标相似。④ <strong>实践场景</strong>——(a) 小 batch 检测/分割(WS+GN);(b) 元学习(MAML 中 WS 提升稳定性);(c) 生成模型(GAN 中用 WS 稳定判别器);(d) 联邦学习(BN 在非 iid 数据上失效,WS 无此问题)。⑤ <strong>实现注意</strong>——WS 需对每个输出通道的卷积核分别标准化(而非对整个权重张量);且需在<strong>每次前向</strong>时重新计算(因为权重会被更新)。⑥ <strong>诊断</strong>——若小 batch 下 BN 表现差且 GN 不够好,可试 WS+GN;若仍不足,考虑 Fixup 或调整初始化。
⚠️ Common Interview Pitfalls
- ✕单独用 WS 而不配 GN/LN(效果有限)
- ✕期望 WS 能替代 BN 的激活分布归一化作用
🎯 Interviewer Follow-ups
- ?为什么标准化权重能替代 BN?
- ?WS 与 BN 的关系?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.