返回 深度学习 思维导图
中文·English
🧠 深度学习ID: normalization-comparison

BN vs LN vs GN 对比

Norm Methods Comparison
🎯核心定义
三种主流归一化的本质差异在统计量的计算维度 (输入 xRN×C×H×Wx \in \mathbb{R}^{N \times C \times H \times W}): • BN (BatchNorm): 统计范围 (N, H, W) — 跨 batch 与空间维, 每通道独立, x^c=xcμB,cσB,c2+ϵ\hat{x}_c = \frac{x_c - \mu_{B,c}}{\sqrt{\sigma_{B,c}^2 + \epsilon}}; • LN (LayerNorm): 统计范围 (C, H, W) — 单样本内跨全部通道, μ=1CHWx\mu = \frac{1}{CHW}\sum x; • GN (GroupNorm): 统计范围 (C/G, H, W) — 单样本内把通道分成 GG 组 (如 32), 组内归一化。
💡使用场景
BN — 大 batch 的 CNN 分类; LN — Transformer/LLM/RNN (与 batch 无关, 变长序列友好); GN — 小 batch 任务 (检测/分割, 每卡 1~2 张图) 及 BN 无法工作的 3D/视频。面试常考: 一张表对比三者统计维度 + 各自失效场景。
解决的核心痛点
归一化稳定激活分布、加速收敛并允许更大学习率; 取舍本质是“统计量跨多少样本/通道共享”: BN 依赖 batch 统计 (小 batch 失真, 训练/推理不一致), LN 完全不依赖 batch 但假设各通道同分布 (对 CNN 特征图不如 BN 贴切, 正则化也更弱), GN 是折中——引入通道分组统计, 小 batch 下稳定且与 batch size 无关, 已成为每卡 1~2 张图的检测任务标配。
🎯5 个高频面试考点 (Exam Points)
1
xRN×C×H×Wx \in \mathbb{R}^{N \times C \times H \times W}, 画出 BN/LN/GN 的归一化维度对比: 各自统计量的计算范围 (batch/样本/通道) 是什么?
2
为什么 BN 在 Transformer/变长序列中不适用而 LN 成为标配? 两者的 batch 依赖差异?
3
GN 解决什么问题? 在小 batch (每卡 1~2 张) 的检测/分割任务中为什么 BN 失效而 GN 可行?
4
BN 的小 batch 缺陷与 LN 的通道独立性假设各是什么? 什么场景下 LN 不如 BN?
5
归一化为什么能加速训练? 对比内部协变量偏移 (ICS) 与 loss 曲面平滑两种解释视角?
更新于 2026-08-12
🎯
检验攻克程度:针对「BN vs LN vs GN 对比」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点LayerNorm 与 RMSNorm下一个知识点Dropout

🔗 更多 深度学习 知识点卡片

激活函数演进Adam/AdamWAutograd 动态图BatchNorm 批归一化