返回 MLE 工程师 思维导图
中文·English
💻 MLE 工程师ID: mle-recsys-end-to-end-pipeline

亿级推荐系统端到端链路与 SLA

End-to-End RecSys Pipeline & SLA
🎯核心定义
亿级推荐系统端到端链路与 SLA 预算架构 (End-to-End Large-Scale Recommendation Pipeline & SLA Allocation) 是支撑千万级 Item、数亿 DAU 工业级推荐场景的经典多阶段级联流水线;在严格的 50ms 端到端延迟 SLA 下完成四阶段层级过滤:1) 多路召回层 (Retrieval: 10ms 预算,结合 DSSM 双塔 ANN、ItemCF、热门兜底与实时兴趣流,从 10710^7 物品中召回 10410^4 候选);2) 粗排层 (Pre-ranking: 5ms 预算,轻量级双塔/小型蒸馏 DNN 快速过滤至 10310^3 候选);3) 精排层 (Heavy Ranking: 30ms 预算,基于 DCN-v2 / MMoE / PLE 多目标网络精准打分,输出 Top 100 优质列表);4) 重排与多样性 (Re-ranking: 5ms 预算,基于 DPP / MMR 与业务规则打散生成最终 Top 10)。
💡使用场景
淘宝/Amazon 电商首页、抖音/TikTok 沉浸式信息流、小红书探索瀑布流。
解决的核心痛点
复杂的深度精排模型无法对千万级候选库直接推理;端到端级联漏斗在各阶段严格平衡模型表达力与候选规模,在 50ms 极低延迟下逼近全局最优收益。
🎯5 个高频面试考点 (Exam Points)
1
详细画出 4 阶段推荐漏斗架构图,并分解各阶段候选规模(10710410310210110^7 \to 10^4 \to 10^3 \to 10^2 \to 10^1)与延迟预算?
2
DSSM 双塔召回模型为什么在线推理时只执行 User 塔前向,而 Item 塔完全采用离线预计算 + 向量索引 (HNSW/IVF)?
3
多目标精排模型 (MMoE / PLE) 如何同时兼顾点击率 (CTR)、转化率 (CVR) 与播放时长 (Watch Time) 并加权融合成最终排序分?
4
重排阶段的行列式点过程 (DPP) 算法如何平衡推荐列表的相关度质量与商品类目多样性?
5
当精排层遭遇流量洪峰导致 P99 延迟超标时,推荐网关的动态候选集截断与服务熔断降级策略?
📖 关联深度指南:📄 mle-system-design-guide
更新于 2026-08-14
🎯
检验攻克程度:针对「亿级推荐系统端到端链路与 SLA」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点MLE 系统设计 5 步面试方法论下一个知识点Feature Store 一致性与穿越规避

🔗 更多 MLE 工程师 知识点卡片

偏差-方差权衡与过拟合诊断常见损失函数选型与梯度特性优化器收敛性与动量选型准则模型集成 Stacking 与 Blending