🎯核心定义
Dense 模型每个 token 激活全部参数;MoE 每个 token 只激活部分专家参数 (稀疏激活)。在相同激活参数量下 (如 37B active),MoE 的总参数量可以数倍于 Dense (DeepSeek-V3: 671B 总参 / 37B 激活)——同等计算量下容量更大;但 MoE 需要存储全部专家权重、引入专家间的 all-to-all 通信,服务时显存占用更高、调度更复杂,量化/蒸馏等后续压缩也更难。
💡使用场景
算力预算固定但追求能力上限的预训练选 MoE;延迟敏感、显存受限、工程维护成本敏感的中小规模部署选 Dense;实践中 MoE 常配合蒸馏与量化做二次压缩,或用共享专家 (shared expert) 混合设计平衡两者。
⚡解决的核心痛点
Dense 在固定训练 FLOPs 内模型容量存在天花板;MoE 用稀疏激活换取更大容量,但把成本从“训练算力”转移到了“部署显存与工程复杂度”——选型本质是能力上限与服务成本/复杂度的权衡。