返回 工业系统设计 思维导图
中文·English
🏗️ 工业系统设计ID: mmoe-multitask-learning

MMoE 多门控专家混合模型

MMoE Multi-Gate Mixture-of-Experts
🎯核心定义
MMoE(Multi-gate Mixture-of-Experts,由 Google 团队在 KDD 2018 提出)是一种专为解决多任务学习中不同目标之间相关性微弱或存在冲突时的多目标排序与推荐神经网络架构;传统 Shared-Bottom(共享底层网络)架构强迫所有任务共用同一个底层表示,极易引发负迁移 (Negative Transfer);MMoE 引入了一组由 EE 个并行子网络组成的共享专家池 (Shared Experts f1,f2,,fEf_1, f_2, \dots, f_E),并为每一个独立的预测任务 kk(如任务 1 为点击率 CTR,任务 2 为转化率 CVR,任务 3 为观看时长)配备专属的门控网络 (Gating Network: gk(x)=softmax(Wgkx)g^k(x) = \text{softmax}(W_g^k x));每个任务对所有专家的输出进行动态加权聚合 yk=hk(i=1Egik(x)fi(x))y_k = h^k\left(\sum_{i=1}^E g_i^k(x) f_i(x)\right) 后再输入各自的任务塔 (Tower)。
💡使用场景
同时优化点击、点赞、收藏、转发、购买、时长等多个不同甚至冲突业务目标的现代多任务推荐与广告精排系统。
解决的核心痛点
早期共享底层网络在任务相关度低(如“点击”与“购买”关联微弱)时性能发生剧烈退化;MMoE 通过为每个任务赋予独立的动态路由注意力权重,允许专家自适应专业化分工,彻底攻克多任务负迁移难题。
🎯5 个高频面试考点 (Exam Points)
1
推导 MMoE 的多门控专家数学表达式 yk=hk(i=1Egik(x)fi(x))y_k = h^k(\sum_{i=1}^E g_i^k(x) f_i(x)),并对比其与单门控 MoE 及 Shared-Bottom 的差异?
2
为什么当两个任务完全不相关或呈负相关(如“点击率高但停留时长极短的标题党”)时,MMoE 的门控网络能自动将专家注意力正交化?
3
多任务损失函数加权 L=k=1KwkLk\mathcal{L} = \sum_{k=1}^K w_k \mathcal{L}_k 中,动态损失平衡算法(如 GradNorm / UW 不确定性加权)如何动态调优各任务权重 wkw_k
4
MMoE 专家池数量 EE(如 E=48E=4\sim 8)的选择对模型参数量膨胀与 GPU 算力吞吐的量化制约关系?
5
MMoE 架构为何仍然存在“所有专家均为完全共享,缺乏任务独占专家”的局限性?(由此引出腾讯的 PLE 架构)
更新于 2026-08-14
🎯
检验攻克程度:针对「MMoE 多门控专家混合模型」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点DCN-v2 深度特征交叉网络下一个知识点PLE 渐进式分层抽取架构

🔗 更多 工业系统设计 知识点卡片

推荐多阶段漏斗与 50ms SLADSSM 双塔向量化召回YouTube DNN 召回架构粗排轻量模型与向量相似度剪枝