TalentMe
How To
🗺️
AI Industry Map
NEW
Knowledge ▾
Intro & Usage
Machine Learning Repo
Data Science Repo
Resources ▾
Intro & Usage
AI Tech Vault (Tech Wiki)
Industry News
Tech Blogs
Research Papers
Open Source Projects
Tools Hub ▾
🛠️ Tools & Skills Overview
🌐 Interactive Web Tools
🗺️ AI Industry & Career Map
🧭 AI Career Transition Navigator & Roadmap
📚 AI Multi-Module Practice Hub
🎯 AI Skill Assessment
🧠 AI Skills Library
AI Skills & Prompts Overview
Local Agent Guide
Cloud Skills Templates
⚡ MCP Tools Suite
TalentMe MCP Guide
CLI Tools & Commands
Services ▾
🚀 Services & Plans Suite
🧭 1v1 Coaching & Services
💎 Plans & Pricing
💬 Contact & Consultation
Contact Us
💬 Discord
🌐
中
☀️
🔑
Login / Register
☰
技术知识库
›
复习路线图
›
大语言模型 思维导图
›
MoE 路由 Top-k
← 返回 大语言模型 思维导图
中文
·
English
⚡ 大语言模型
ID:
moe-routing
MoE 路由 Top-k
MoE Routing Top-k
🎯
核心定义
MoE (Mixture-of-Experts) 在 FFN 层放置
N
N
N
个专家,门控网络
g
(
x
)
=
softmax
(
W
g
x
)
g(x) = \text{softmax}(W_g x)
g
(
x
)
=
softmax
(
W
g
x
)
为每个 token 打分并选 top-
k
k
k
个专家,输出为加权和
y
=
∑
i
∈
top-
k
g
i
(
x
)
E
i
(
x
)
y = \sum_{i \in \text{top-}k} g_i(x) E_i(x)
y
=
∑
i
∈
top-
k
g
i
(
x
)
E
i
(
x
)
;以 DeepSeek-V3 为例,总参 671B,但每个 token 仅激活 37B——稀疏激活是 MoE 的核心机制。
💡
使用场景
大规模预训练——在相同 FLOPs 预算下用更多参数换取更大容量;推理时只计算被路由到的专家,降低每 token 计算量;Llama 4、DeepSeek、Mixtral 等主流模型均采用 top-2 或更大 top-k 路由。
⚡
解决的核心痛点
Dense 模型扩参意味着同比例增加计算量;MoE 用条件计算 (conditional computation) 打破“参数量≈计算量”的绑定,让总参数可以数倍于激活参数,在算力预算不变时显著提升模型容量与能力上限。
🎯
5 个高频面试考点 (Exam Points)
1
MoE 路由如何工作?top-k 选择意味着什么?
2
为什么 671B 总参只有 37B 激活?激活参数的含义?
3
门控网络的输入与训练方式是什么?
4
top-1 与 top-2 路由的权衡?
5
MoE 为什么能同时降低训练和推理成本?
📖 关联深度指南:
📄 moe-architecture →
更新于 2026-08-12
🎯
检验攻克程度:针对「MoE 路由 Top-k」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题 ➔
← 上一个知识点
知识蒸馏
下一个知识点 →
负载均衡损失
🔗 更多 大语言模型 知识点卡片
Agent 与工具调用
对齐税与偏好数据
缩放点积注意力
注意力变体 MHA/MQA/GQA