TalentMe
How To
🗺️
AI Industry Map
NEW
Knowledge ▾
Intro & Usage
Machine Learning Repo
Data Science Repo
Resources ▾
Intro & Usage
AI Tech Vault (Tech Wiki)
Industry News
Tech Blogs
Research Papers
Open Source Projects
Tools Hub ▾
🛠️ Tools & Skills Overview
🌐 Interactive Web Tools
🗺️ AI Industry & Career Map
🧭 AI Career Transition Navigator & Roadmap
📚 AI Multi-Module Practice Hub
🎯 AI Skill Assessment
🧠 AI Skills Library
AI Skills & Prompts Overview
Local Agent Guide
Cloud Skills Templates
⚡ MCP Tools Suite
TalentMe MCP Guide
CLI Tools & Commands
Services ▾
🚀 Services & Plans Suite
🧭 1v1 Coaching & Services
💎 Plans & Pricing
💬 Contact & Consultation
Contact Us
💬 Discord
🌐
中
☀️
🔑
Login / Register
☰
技术知识库
›
复习路线图
›
大语言模型 思维导图
›
归一化 Pre-LN/RMSNorm
← 返回 大语言模型 思维导图
中文
·
English
⚡ 大语言模型
ID:
preln-rmsnorm
归一化 Pre-LN/RMSNorm
Pre-LN & RMSNorm
🎯
核心定义
LayerNorm 沿最后一维标准化:
L
N
(
x
)
=
x
−
m
e
a
n
v
a
r
⋅
γ
+
β
LN(x) = \frac{x - mean}{\sqrt{var}} \cdot \gamma + \beta
L
N
(
x
)
=
v
a
r
x
−
m
e
an
⋅
γ
+
β
;Pre-LN 把归一化放在残差子层之前(
x
+
S
u
b
L
a
y
e
r
(
L
N
(
x
)
)
x + SubLayer(LN(x))
x
+
S
u
b
L
a
y
er
(
L
N
(
x
))
),Post-LN 放在残差相加之后;RMSNorm 去掉均值项,只按均方根缩放:
R
M
S
N
o
r
m
(
x
)
=
x
m
e
a
n
(
x
2
)
⋅
γ
RMSNorm(x) = \frac{x}{\sqrt{mean(x^2)}} \cdot \gamma
R
M
S
N
or
m
(
x
)
=
m
e
an
(
x
2
)
x
⋅
γ
。
💡
使用场景
LLaMA/Mistral/Qwen 等主流模型全部用 Pre-LN + RMSNorm;面试常考"为什么 Pre-LN 训练深层更稳""RMSNorm 为什么能去均值"。
⚡
解决的核心痛点
Post-LN 中残差信号被逐层归一化衰减,深层训练不稳定,需要精细 warmup 与梯度裁剪;Pre-LN 让梯度沿残差恒等路径直接回传,深层稳定;RMSNorm 去掉均值计算(归一化算力约省 1/3),且实验表明重中心化对 Transformer 精度几乎无影响,因此可以省略。
🎯
5 个高频面试考点 (Exam Points)
1
Pre-LN 与 Post-LN 的结构区别?为什么 Pre-LN 深层训练更稳定?
2
RMSNorm 的公式?与 LayerNorm 的差异及为什么去掉均值可行?
3
Pre-LN 的缺点?(残差信号漂移,后期精度可能不如 Post-LN,可预热后切换)
4
归一化在残差内外的位置为什么重要?
γ
\gamma
γ
缩放参数为什么必须保留?
5
DeepNorm 解决什么问题?(Post-LN 千层模型的稳定训练)
📖 关联深度指南:
📄 transformer-architecture →
更新于 2026-08-12
🎯
检验攻克程度:针对「归一化 Pre-LN/RMSNorm」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题 ➔
← 上一个知识点
前馈层与激活
下一个知识点 →
FlashAttention
🔗 更多 大语言模型 知识点卡片
Agent 与工具调用
对齐税与偏好数据
缩放点积注意力
注意力变体 MHA/MQA/GQA