返回 大语言模型 思维导图
中文·English
大语言模型ID: preln-rmsnorm

归一化 Pre-LN/RMSNorm

Pre-LN & RMSNorm
🎯核心定义
LayerNorm 沿最后一维标准化:LN(x)=xmeanvarγ+βLN(x) = \frac{x - mean}{\sqrt{var}} \cdot \gamma + \beta;Pre-LN 把归一化放在残差子层之前(x+SubLayer(LN(x))x + SubLayer(LN(x))),Post-LN 放在残差相加之后;RMSNorm 去掉均值项,只按均方根缩放:RMSNorm(x)=xmean(x2)γRMSNorm(x) = \frac{x}{\sqrt{mean(x^2)}} \cdot \gamma
💡使用场景
LLaMA/Mistral/Qwen 等主流模型全部用 Pre-LN + RMSNorm;面试常考"为什么 Pre-LN 训练深层更稳""RMSNorm 为什么能去均值"。
解决的核心痛点
Post-LN 中残差信号被逐层归一化衰减,深层训练不稳定,需要精细 warmup 与梯度裁剪;Pre-LN 让梯度沿残差恒等路径直接回传,深层稳定;RMSNorm 去掉均值计算(归一化算力约省 1/3),且实验表明重中心化对 Transformer 精度几乎无影响,因此可以省略。
🎯5 个高频面试考点 (Exam Points)
1
Pre-LN 与 Post-LN 的结构区别?为什么 Pre-LN 深层训练更稳定?
2
RMSNorm 的公式?与 LayerNorm 的差异及为什么去掉均值可行?
3
Pre-LN 的缺点?(残差信号漂移,后期精度可能不如 Post-LN,可预热后切换)
4
归一化在残差内外的位置为什么重要?γ\gamma 缩放参数为什么必须保留?
5
DeepNorm 解决什么问题?(Post-LN 千层模型的稳定训练)
📖 关联深度指南:📄 transformer-architecture
更新于 2026-08-12
🎯
检验攻克程度:针对「归一化 Pre-LN/RMSNorm」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点前馈层与激活下一个知识点FlashAttention

🔗 更多 大语言模型 知识点卡片

Agent 与工具调用对齐税与偏好数据缩放点积注意力注意力变体 MHA/MQA/GQA