返回 大语言模型 思维导图
中文·English
大语言模型ID: moe-load-balance

负载均衡损失

MoE Load Balancing
🎯核心定义
若不加约束,门控会让 token 扎堆到少数专家,产生负载不均与专家退化 (routing collapse, 少数专家吸收几乎所有信号)。缓解手段: 辅助均衡损失 Laux=αNi=1NfiPi\mathcal{L}_{\text{aux}} = \alpha \cdot N \sum_{i=1}^{N} f_i P_i,其中 fif_i 是专家 ii 的 token 占比 (实际利用率)、PiP_i 是路由概率均值,两者之积均匀化即鼓励均匀路由;同时设置专家容量上限 (capacity factor, 每专家最大 token 数 = 容量因子 × 平均负载),超限 token 被丢弃或走残差路径 (recompute/残差连接)。
💡使用场景
任何 top-k MoE 训练 (Switch Transformer、Mixtral、DeepSeek-V3 等) 的标配组件;推理时容量上限同样必要,它把单 batch 内的计算量固定在确定边界内,避免个别专家过热拖慢整体延迟。
解决的核心痛点
负载不均使部分专家闲置、部分过载,浪费显存与算力;专家崩溃会让 MoE 退化成少数专家在起作用,能力不如同参 Dense;均衡损失保证每个专家都获得训练信号,容量上限保证训练/推理的确定性。
🎯5 个高频面试考点 (Exam Points)
1
负载均衡损失公式中 f_i、P_i、α、N 各是什么?
2
为什么会出现负载不均?专家崩溃 (routing collapse) 是什么?
3
容量因子 (capacity factor) 是什么?过大/过小的影响?
4
超限 token 如何处理?
5
均衡损失权重 α 太大/太小的权衡?
📖 关联深度指南:📄 moe-architecture
更新于 2026-08-12
🎯
检验攻克程度:针对「负载均衡损失」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点MoE 路由 Top-k下一个知识点Dense vs MoE 对比

🔗 更多 大语言模型 知识点卡片

Agent 与工具调用对齐税与偏好数据缩放点积注意力注意力变体 MHA/MQA/GQA