返回 大语言模型 思维导图
中文·English
大语言模型ID: moe-routing

MoE 路由 Top-k

MoE Routing Top-k
🎯核心定义
MoE (Mixture-of-Experts) 在 FFN 层放置 NN 个专家,门控网络 g(x)=softmax(Wgx)g(x) = \text{softmax}(W_g x) 为每个 token 打分并选 top-kk 个专家,输出为加权和 y=itop-kgi(x)Ei(x)y = \sum_{i \in \text{top-}k} g_i(x) E_i(x);以 DeepSeek-V3 为例,总参 671B,但每个 token 仅激活 37B——稀疏激活是 MoE 的核心机制。
💡使用场景
大规模预训练——在相同 FLOPs 预算下用更多参数换取更大容量;推理时只计算被路由到的专家,降低每 token 计算量;Llama 4、DeepSeek、Mixtral 等主流模型均采用 top-2 或更大 top-k 路由。
解决的核心痛点
Dense 模型扩参意味着同比例增加计算量;MoE 用条件计算 (conditional computation) 打破“参数量≈计算量”的绑定,让总参数可以数倍于激活参数,在算力预算不变时显著提升模型容量与能力上限。
🎯5 个高频面试考点 (Exam Points)
1
MoE 路由如何工作?top-k 选择意味着什么?
2
为什么 671B 总参只有 37B 激活?激活参数的含义?
3
门控网络的输入与训练方式是什么?
4
top-1 与 top-2 路由的权衡?
5
MoE 为什么能同时降低训练和推理成本?
📖 关联深度指南:📄 moe-architecture
更新于 2026-08-12
🎯
检验攻克程度:针对「MoE 路由 Top-k」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点知识蒸馏下一个知识点负载均衡损失

🔗 更多 大语言模型 知识点卡片

Agent 与工具调用对齐税与偏好数据缩放点积注意力注意力变体 MHA/MQA/GQA