返回 工业系统设计 思维导图
中文·English
🏗️ 工业系统设计ID: recsys-ab-testing-interleaving

推荐在线 A/B 实验与 Interleaving

Online A/B Testing & Interleaving
🎯核心定义
在线 A/B 实验与交替穿插实验 (Online A/B Testing & Interleaving) 是推荐与搜索系统在线验证新算法能否带来真实商业价值、决定最终是否全量推全的终极决策科学体系;1) 标准 A/B 测试 (Randomized Controlled Trial): 将用户流量哈希分流为对照组 (Control Group) 与实验组 (Treatment Group),保持双盲运行若干天并统计核心业务指标(CTR、GMV、人均时长、留存率)与护栏指标(崩溃率、延迟),基于双样本 t 检验判断 p-value 统计显著性;2) Interleaving (交替实验,如 Team Draft Interleaving): 在单次请求内将算法 A 与算法 B 的推荐列表交替穿插为一个统一列表展示给同一用户,根据用户点击项的归属直接计算胜率,测试灵敏度比标准 A/B 高出 100 倍。
💡使用场景
推荐/搜索/广告算法上线前的灰度放量、模型快速筛选淘汰与核心业务 KPI 因果推断。
解决的核心痛点
离线指标(GAUC/NDCG)与线上真实业务指标存在不可避免的鸿沟(离线涨线上跌);Interleaving 能在极小样本量和数小时内快速淘汰劣质模型,A/B 测试则提供长期全局业务收益的严谨因果推断。
🎯5 个高频面试考点 (Exam Points)
1
详细描述 Team Draft Interleaving (球队选秀交替算法) 的交替合并规则与点击归属 (Credit Assignment) 的无偏计算?
2
为什么 Interleaving 能够在仅需标准 A/B 测试 1% 的样本量和 1/10 的时间下达到相同的统计功效 (Statistical Power)?
3
多层正交实验分层体系 (Overlapping Layered Experiment Architecture / Google 分层实验) 的参数哈希设计?
4
如何检测与防范 A/B 实验中的样本比例不平衡 (Sample Ratio Mismatch, SRM) 与网络溢出效应 (Network Spillover Effects)?
5
新颖性效应 (Novelty Effect: 用户因 UI 新鲜产生短期偏好) 与慢炖效应 (Slow Cooker Effect: 长期留存需数周显现) 的应对策略?
更新于 2026-08-14
🎯
检验攻克程度:针对「推荐在线 A/B 实验与 Interleaving」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点推荐离线指标 GAUC 与 NDCG下一个知识点Query 理解、分词与意图分类

🔗 更多 工业系统设计 知识点卡片

推荐多阶段漏斗与 50ms SLADSSM 双塔向量化召回YouTube DNN 召回架构粗排轻量模型与向量相似度剪枝