TalentMe
How To
🗺️
AI Industry Map
NEW
Knowledge ▾
Intro & Usage
Machine Learning Repo
Data Science Repo
Resources ▾
Intro & Usage
AI Tech Vault (Tech Wiki)
Industry News
Tech Blogs
Research Papers
Open Source Projects
Tools Hub ▾
🛠️ Tools & Skills Overview
🌐 Interactive Web Tools
🗺️ AI Industry & Career Map
🧭 AI Career Transition Navigator & Roadmap
📚 AI Multi-Module Practice Hub
🎯 AI Skill Assessment
🧠 AI Skills Library
AI Skills & Prompts Overview
Local Agent Guide
Cloud Skills Templates
⚡ MCP Tools Suite
TalentMe MCP Guide
CLI Tools & Commands
Services ▾
🚀 Services & Plans Suite
🧭 1v1 Coaching & Services
💎 Plans & Pricing
💬 Contact & Consultation
Contact Us
💬 Discord
🌐
中
☀️
🔑
Login / Register
☰
技术知识库
›
复习路线图
›
深度学习 思维导图
›
BN vs LN vs GN 对比
← 返回 深度学习 思维导图
中文
·
English
🧠 深度学习
ID:
normalization-comparison
BN vs LN vs GN 对比
Norm Methods Comparison
🎯
核心定义
三种主流归一化的本质差异在统计量的计算维度 (输入
x
∈
R
N
×
C
×
H
×
W
x \in \mathbb{R}^{N \times C \times H \times W}
x
∈
R
N
×
C
×
H
×
W
): • BN (BatchNorm): 统计范围 (N, H, W) — 跨 batch 与空间维, 每通道独立,
x
^
c
=
x
c
−
μ
B
,
c
σ
B
,
c
2
+
ϵ
\hat{x}_c = \frac{x_c - \mu_{B,c}}{\sqrt{\sigma_{B,c}^2 + \epsilon}}
x
^
c
=
σ
B
,
c
2
+
ϵ
x
c
−
μ
B
,
c
; • LN (LayerNorm): 统计范围 (C, H, W) — 单样本内跨全部通道,
μ
=
1
C
H
W
∑
x
\mu = \frac{1}{CHW}\sum x
μ
=
C
H
W
1
∑
x
; • GN (GroupNorm): 统计范围 (C/G, H, W) — 单样本内把通道分成
G
G
G
组 (如 32), 组内归一化。
💡
使用场景
BN — 大 batch 的 CNN 分类; LN — Transformer/LLM/RNN (与 batch 无关, 变长序列友好); GN — 小 batch 任务 (检测/分割, 每卡 1~2 张图) 及 BN 无法工作的 3D/视频。面试常考: 一张表对比三者统计维度 + 各自失效场景。
⚡
解决的核心痛点
归一化稳定激活分布、加速收敛并允许更大学习率; 取舍本质是“统计量跨多少样本/通道共享”: BN 依赖 batch 统计 (小 batch 失真, 训练/推理不一致), LN 完全不依赖 batch 但假设各通道同分布 (对 CNN 特征图不如 BN 贴切, 正则化也更弱), GN 是折中——引入通道分组统计, 小 batch 下稳定且与 batch size 无关, 已成为每卡 1~2 张图的检测任务标配。
🎯
5 个高频面试考点 (Exam Points)
1
对
x
∈
R
N
×
C
×
H
×
W
x \in \mathbb{R}^{N \times C \times H \times W}
x
∈
R
N
×
C
×
H
×
W
, 画出 BN/LN/GN 的归一化维度对比: 各自统计量的计算范围 (batch/样本/通道) 是什么?
2
为什么 BN 在 Transformer/变长序列中不适用而 LN 成为标配? 两者的 batch 依赖差异?
3
GN 解决什么问题? 在小 batch (每卡 1~2 张) 的检测/分割任务中为什么 BN 失效而 GN 可行?
4
BN 的小 batch 缺陷与 LN 的通道独立性假设各是什么? 什么场景下 LN 不如 BN?
5
归一化为什么能加速训练? 对比内部协变量偏移 (ICS) 与 loss 曲面平滑两种解释视角?
📖 关联深度指南:
📄 normalization-and-regularization →
更新于 2026-08-12
🎯
检验攻克程度:针对「BN vs LN vs GN 对比」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题 ➔
← 上一个知识点
LayerNorm 与 RMSNorm
下一个知识点 →
Dropout
🔗 更多 深度学习 知识点卡片
激活函数演进
Adam/AdamW
Autograd 动态图
BatchNorm 批归一化