返回 深度学习 思维导图
中文·English
🧠 深度学习ID: layernorm-rmsnorm

LayerNorm 与 RMSNorm

LayerNorm & RMSNorm
🎯核心定义
LayerNorm (层归一化) 在单个样本内沿特征维归一化, 与 batch 无关: 对 xRdx \in \mathbb{R}^d 计算 μ=1di=1dxi\mu = \frac{1}{d}\sum_{i=1}^{d}x_iσ2=1di=1d(xiμ)2\sigma^2 = \frac{1}{d}\sum_{i=1}^{d}(x_i-\mu)^2, 得 y=γxμσ2+ϵ+βy = \gamma\frac{x-\mu}{\sqrt{\sigma^2+\epsilon}} + \beta。RMSNorm 是 LN 的简化: 去掉均值中心化, 只做 y=x1di=1dxi2+ϵγy = \frac{x}{\sqrt{\frac{1}{d}\sum_{i=1}^{d}x_i^2 + \epsilon}}\cdot\gamma
💡使用场景
Transformer/NLP/RNN 标配 (序列变长, batch 统计不可靠); RMSNorm 是 LLaMA/Qwen 等 LLM 的默认选择 (省去均值与偏置计算, 训练提速约 7%~30%)。面试常问: LN 为什么与 batch size 无关、RMSNorm 为什么够用、Pre-Norm 位置。
解决的核心痛点
摆脱对 batch 的依赖, batch=1 也能正常工作, 且变长序列无 padding 污染。为什么去掉中心化仍够用: 层内天然具有重定心/重缩放不变性, 均值项会被后续残差层吸收; 代价是正则化作用比 BN 弱 (没有 batch 间统计噪声)。
🎯5 个高频面试考点 (Exam Points)
1
写出 LayerNorm 公式 y=γxμσ2+ϵ+βy = \gamma\frac{x-\mu}{\sqrt{\sigma^2+\epsilon}}+\beta 并说明它沿哪个维度归一化、为什么与 batch size 无关?
2
RMSNorm 与 LN 的区别: 去掉均值中心化为什么影响很小? 在 LLM 中主要省了什么 (计算量/提速多少)?
3
LN 中 γ,β\gamma, \beta 的作用: 去掉可学习参数会发生什么? 为什么需要它们恢复表达能力?
4
Pre-Norm 与 Post-Norm 的区别, 为什么现代 Transformer 用 Pre-LN (训练稳定性、残差梯度路径)?
5
为什么 RNN/变长序列场景必须用 LN 而非 BN? 对比两者在 batch 依赖、padding 处理上的差异?
更新于 2026-08-12
🎯
检验攻克程度:针对「LayerNorm 与 RMSNorm」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点BatchNorm 批归一化下一个知识点BN vs LN vs GN 对比

🔗 更多 深度学习 知识点卡片

激活函数演进Adam/AdamWAutograd 动态图经典 CNN 演进