TalentMe
How To
🗺️
AI Industry Map
NEW
Knowledge ▾
Intro & Usage
Machine Learning Repo
Data Science Repo
Resources ▾
Intro & Usage
AI Tech Vault (Tech Wiki)
Industry News
Tech Blogs
Research Papers
Open Source Projects
Tools Hub ▾
🛠️ Tools & Skills Overview
🌐 Interactive Web Tools
🗺️ AI Industry & Career Map
🧭 AI Career Transition Navigator & Roadmap
📚 AI Multi-Module Practice Hub
🎯 AI Skill Assessment
🧠 AI Skills Library
AI Skills & Prompts Overview
Local Agent Guide
Cloud Skills Templates
⚡ MCP Tools Suite
TalentMe MCP Guide
CLI Tools & Commands
Services ▾
🚀 Services & Plans Suite
🧭 1v1 Coaching & Services
💎 Plans & Pricing
💬 Contact & Consultation
Contact Us
💬 Discord
🌐
中
☀️
🔑
Login / Register
☰
技术知识库
›
复习路线图
›
大语言模型 思维导图
›
前馈层与激活
← 返回 大语言模型 思维导图
中文
·
English
⚡ 大语言模型
ID:
feedforward-swiglu
前馈层与激活
FFN & SwiGLU
🎯
核心定义
Transformer 前馈层
F
F
N
(
x
)
=
W
2
⋅
G
E
L
U
(
W
1
x
)
FFN(x) = W_2 \cdot GELU(W_1 x)
F
F
N
(
x
)
=
W
2
⋅
GE
LU
(
W
1
x
)
,占模型参数约 2/3(非嵌入参数);SwiGLU 是门控激活:
S
w
i
G
L
U
(
x
)
=
(
S
i
L
U
(
x
W
g
)
)
⋅
(
x
W
u
)
W
d
SwiGLU(x) = (SiLU(x W_g)) \cdot (x W_u) W_d
S
w
i
G
LU
(
x
)
=
(
S
i
LU
(
x
W
g
))
⋅
(
x
W
u
)
W
d
,其中
S
i
L
U
(
x
)
=
x
⋅
s
i
g
m
o
i
d
(
x
)
SiLU(x) = x \cdot sigmoid(x)
S
i
LU
(
x
)
=
x
⋅
s
i
g
m
o
i
d
(
x
)
即 Swish,中间维度从
4
d
4d
4
d
降到
8
3
d
\frac{8}{3}d
3
8
d
(LLaMA-2 7B: 隐藏维 4096 → 中间维 11008)。
💡
使用场景
LLaMA-2/3、Qwen、Mistral、Gemma 等 2023 后主流模型全部用 SwiGLU 替代 GELU MLP;面试常考"为什么用门控激活""中间维为什么是 8/3 d"以及训练时的激活显存问题。
⚡
解决的核心痛点
普通 MLP 的 ReLU/GELU 无输入条件选择,信息对所有 token 固定流动;
4
d
4d
4
d
中间维带来大量参数与激活;SwiGLU 用输入依赖的门控让不同 token 走不同"子网络",同等参数量下质量更好,同时中间维缩小(
4
d
→
8
3
d
4d \rightarrow \frac{8}{3}d
4
d
→
3
8
d
),参数与训练激活显存反而下降。
🎯
5 个高频面试考点 (Exam Points)
1
FFN 为什么占参数约 2/3?中间维度
4
d
4d
4
d
与
8
3
d
\frac{8}{3}d
3
8
d
的设计?
2
SwiGLU 与普通 GELU MLP 的本质区别?(输入依赖的门控机制)
3
SiLU/Swish 的性质:为什么比 ReLU 更平滑、无饱和?
4
GLU 家族对比:ReGLU、GEGLU、SwiGLU 分别用什么激活?
5
训练时 FFN 激活显存为什么大?如何缓解?(激活缓存、重算)
📖 关联深度指南:
📄 transformer-architecture →
更新于 2026-08-12
🎯
检验攻克程度:针对「前馈层与激活」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题 ➔
← 上一个知识点
RoPE 外推方案 PI/NTK/YaRN
下一个知识点 →
归一化 Pre-LN/RMSNorm
🔗 更多 大语言模型 知识点卡片
Agent 与工具调用
对齐税与偏好数据
缩放点积注意力
注意力变体 MHA/MQA/GQA