TalentMe
How To
🗺️
AI Industry Map
NEW
Knowledge ▾
Intro & Usage
Machine Learning Repo
Data Science Repo
Resources ▾
Intro & Usage
AI Tech Vault (Tech Wiki)
Industry News
Tech Blogs
Research Papers
Open Source Projects
Tools Hub ▾
🛠️ Tools & Skills Overview
🌐 Interactive Web Tools
🗺️ AI Industry & Career Map
🧭 AI Career Transition Navigator & Roadmap
📚 AI Multi-Module Practice Hub
🎯 AI Skill Assessment
🧠 AI Skills Library
AI Skills & Prompts Overview
Local Agent Guide
Cloud Skills Templates
⚡ MCP Tools Suite
TalentMe MCP Guide
CLI Tools & Commands
Services ▾
🚀 Services & Plans Suite
🧭 1v1 Coaching & Services
💎 Plans & Pricing
💬 Contact & Consultation
Contact Us
💬 Discord
🌐
中
☀️
🔑
Login / Register
☰
技术知识库
›
复习路线图
›
深度学习 思维导图
›
LayerNorm 与 RMSNorm
← 返回 深度学习 思维导图
中文
·
English
🧠 深度学习
ID:
layernorm-rmsnorm
LayerNorm 与 RMSNorm
LayerNorm & RMSNorm
🎯
核心定义
LayerNorm (层归一化) 在单个样本内沿特征维归一化, 与 batch 无关: 对
x
∈
R
d
x \in \mathbb{R}^d
x
∈
R
d
计算
μ
=
1
d
∑
i
=
1
d
x
i
\mu = \frac{1}{d}\sum_{i=1}^{d}x_i
μ
=
d
1
∑
i
=
1
d
x
i
、
σ
2
=
1
d
∑
i
=
1
d
(
x
i
−
μ
)
2
\sigma^2 = \frac{1}{d}\sum_{i=1}^{d}(x_i-\mu)^2
σ
2
=
d
1
∑
i
=
1
d
(
x
i
−
μ
)
2
, 得
y
=
γ
x
−
μ
σ
2
+
ϵ
+
β
y = \gamma\frac{x-\mu}{\sqrt{\sigma^2+\epsilon}} + \beta
y
=
γ
σ
2
+
ϵ
x
−
μ
+
β
。RMSNorm 是 LN 的简化: 去掉均值中心化, 只做
y
=
x
1
d
∑
i
=
1
d
x
i
2
+
ϵ
⋅
γ
y = \frac{x}{\sqrt{\frac{1}{d}\sum_{i=1}^{d}x_i^2 + \epsilon}}\cdot\gamma
y
=
d
1
∑
i
=
1
d
x
i
2
+
ϵ
x
⋅
γ
。
💡
使用场景
Transformer/NLP/RNN 标配 (序列变长, batch 统计不可靠); RMSNorm 是 LLaMA/Qwen 等 LLM 的默认选择 (省去均值与偏置计算, 训练提速约 7%~30%)。面试常问: LN 为什么与 batch size 无关、RMSNorm 为什么够用、Pre-Norm 位置。
⚡
解决的核心痛点
摆脱对 batch 的依赖, batch=1 也能正常工作, 且变长序列无 padding 污染。为什么去掉中心化仍够用: 层内天然具有重定心/重缩放不变性, 均值项会被后续残差层吸收; 代价是正则化作用比 BN 弱 (没有 batch 间统计噪声)。
🎯
5 个高频面试考点 (Exam Points)
1
写出 LayerNorm 公式
y
=
γ
x
−
μ
σ
2
+
ϵ
+
β
y = \gamma\frac{x-\mu}{\sqrt{\sigma^2+\epsilon}}+\beta
y
=
γ
σ
2
+
ϵ
x
−
μ
+
β
并说明它沿哪个维度归一化、为什么与 batch size 无关?
2
RMSNorm 与 LN 的区别: 去掉均值中心化为什么影响很小? 在 LLM 中主要省了什么 (计算量/提速多少)?
3
LN 中
γ
,
β
\gamma, \beta
γ
,
β
的作用: 去掉可学习参数会发生什么? 为什么需要它们恢复表达能力?
4
Pre-Norm 与 Post-Norm 的区别, 为什么现代 Transformer 用 Pre-LN (训练稳定性、残差梯度路径)?
5
为什么 RNN/变长序列场景必须用 LN 而非 BN? 对比两者在 batch 依赖、padding 处理上的差异?
📖 关联深度指南:
📄 normalization-and-regularization →
更新于 2026-08-12
🎯
检验攻克程度:针对「LayerNorm 与 RMSNorm」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题 ➔
← 上一个知识点
BatchNorm 批归一化
下一个知识点 →
BN vs LN vs GN 对比
🔗 更多 深度学习 知识点卡片
激活函数演进
Adam/AdamW
Autograd 动态图
经典 CNN 演进