返回 大语言模型 思维导图
中文·English
大语言模型ID: feedforward-swiglu

前馈层与激活

FFN & SwiGLU
🎯核心定义
Transformer 前馈层 FFN(x)=W2GELU(W1x)FFN(x) = W_2 \cdot GELU(W_1 x),占模型参数约 2/3(非嵌入参数);SwiGLU 是门控激活:SwiGLU(x)=(SiLU(xWg))(xWu)WdSwiGLU(x) = (SiLU(x W_g)) \cdot (x W_u) W_d,其中 SiLU(x)=xsigmoid(x)SiLU(x) = x \cdot sigmoid(x) 即 Swish,中间维度从 4d4d 降到 83d\frac{8}{3}d(LLaMA-2 7B: 隐藏维 4096 → 中间维 11008)。
💡使用场景
LLaMA-2/3、Qwen、Mistral、Gemma 等 2023 后主流模型全部用 SwiGLU 替代 GELU MLP;面试常考"为什么用门控激活""中间维为什么是 8/3 d"以及训练时的激活显存问题。
解决的核心痛点
普通 MLP 的 ReLU/GELU 无输入条件选择,信息对所有 token 固定流动;4d4d 中间维带来大量参数与激活;SwiGLU 用输入依赖的门控让不同 token 走不同"子网络",同等参数量下质量更好,同时中间维缩小(4d83d4d \rightarrow \frac{8}{3}d),参数与训练激活显存反而下降。
🎯5 个高频面试考点 (Exam Points)
1
FFN 为什么占参数约 2/3?中间维度 4d4d83d\frac{8}{3}d 的设计?
2
SwiGLU 与普通 GELU MLP 的本质区别?(输入依赖的门控机制)
3
SiLU/Swish 的性质:为什么比 ReLU 更平滑、无饱和?
4
GLU 家族对比:ReGLU、GEGLU、SwiGLU 分别用什么激活?
5
训练时 FFN 激活显存为什么大?如何缓解?(激活缓存、重算)
📖 关联深度指南:📄 transformer-architecture
更新于 2026-08-12
🎯
检验攻克程度:针对「前馈层与激活」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点RoPE 外推方案 PI/NTK/YaRN下一个知识点归一化 Pre-LN/RMSNorm

🔗 更多 大语言模型 知识点卡片

Agent 与工具调用对齐税与偏好数据缩放点积注意力注意力变体 MHA/MQA/GQA