返回 大语言模型 思维导图
中文·English
大语言模型ID: dense-vs-moe

Dense vs MoE 对比

Dense vs MoE
🎯核心定义
Dense 模型每个 token 激活全部参数;MoE 每个 token 只激活部分专家参数 (稀疏激活)。在相同激活参数量下 (如 37B active),MoE 的总参数量可以数倍于 Dense (DeepSeek-V3: 671B 总参 / 37B 激活)——同等计算量下容量更大;但 MoE 需要存储全部专家权重、引入专家间的 all-to-all 通信,服务时显存占用更高、调度更复杂,量化/蒸馏等后续压缩也更难。
💡使用场景
算力预算固定但追求能力上限的预训练选 MoE;延迟敏感、显存受限、工程维护成本敏感的中小规模部署选 Dense;实践中 MoE 常配合蒸馏与量化做二次压缩,或用共享专家 (shared expert) 混合设计平衡两者。
解决的核心痛点
Dense 在固定训练 FLOPs 内模型容量存在天花板;MoE 用稀疏激活换取更大容量,但把成本从“训练算力”转移到了“部署显存与工程复杂度”——选型本质是能力上限与服务成本/复杂度的权衡。
🎯5 个高频面试考点 (Exam Points)
1
相同激活参数量下 MoE 与 Dense 的能力差异及原因?
2
为什么 MoE 的服务成本更高?
3
MoE 的 all-to-all 通信开销指什么?
4
什么场景该选 Dense 而非 MoE?
5
MoE 如何与量化/蒸馏结合做压缩?
📖 关联深度指南:📄 moe-architecture
更新于 2026-08-12
🎯
检验攻克程度:针对「Dense vs MoE 对比」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点负载均衡损失下一个知识点思维链 CoT

🔗 更多 大语言模型 知识点卡片

Agent 与工具调用对齐税与偏好数据缩放点积注意力注意力变体 MHA/MQA/GQA