M7-098M7: Retrieval, Ranking & RecSysOnline Metrics & GuardrailsHard
Mastery:
Online Metrics & Guardrails: 解释实验平台的能力要求。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 需支持:流量分配(分层/互斥)、指标计算(实时/离线)、方差降低(CUPED)、多重比较校正、以及'实验管理'。
📌 Key Takeaways
- •流量分配:随机化、分层(layer)、互斥域(domain)
- •指标计算:实时/离线、可信(与业务一致)
- •方差降低:CUPED/分层;多重比较校正;实验管理(元数据/生命周期)
📐 Mathematical Derivations
数学机理:<strong>实验平台的核心能力</strong>——(1) <strong>流量分配(assignment)</strong>——(a) <strong>随机化</strong>(用户/会话/设备级);(b) <strong>分层(layering)</strong>——把流量分成<strong>独立的层</strong>(layer),<strong>不同层可同时跑不同实验</strong>(因为层间正交);<strong>关键</strong>——(i) 同层内的实验<strong>互斥</strong>(用户只进一个实验);(ii) 不同层可复用同一批用户(提高实验密度);(iii) <strong>前提</strong>——层间'正交'(一个实验的处理不影响另一层);(c) <strong>互斥域(domain)</strong>——对'相互干扰'的实验(如两个都改首页的实验)放在同一域(互斥);(d) <strong>流量分配</strong>(按比例、按维度);(e) <strong>一致性</strong>(同一用户在不同实验中'看到一致的处理')。(2) <strong>指标计算(metrics)</strong>——(a) <strong>实时</strong>(快速看趋势,用于'早停'与'风险监控');(b) <strong>离线</strong>(准确,用于最终决策);(c) <strong>口径一致性</strong>(与业务报表一致——否则'实验提升'与'业务报表'对不上);(d) <strong>分层指标</strong>(新/老用户、场景、物品);(e) <strong>护栏指标</strong>(自动监控)。(3) <strong>方差降低(variance reduction)</strong>——(a) <strong>CUPED(Controlled-experiment Using Pre-Experiment Data)</strong>——用'实验前的指标'作为协变量,<strong>减去其解释的部分</strong>:Y'=Y−θ(X−E[X]);<strong>效果</strong>——(i) 若'实验前指标'与'实验指标'相关,则 Y' 的方差降低;(ii) 通常降低 30%~50% 的方差(相当于样本量增加 2~4 倍);<strong>优点</strong>——几乎免费(只需实验前数据);(b) <strong>分层/配对</strong>(按特征分层随机化);(c) <strong>协变量调整</strong>(回归调整);(d) <strong>序列检验</strong>(早停的方差控制)。(4) <strong>多重比较校正</strong>——(a) FDR/Bonferroni(见多重比较题);(b) <strong>预注册主指标</strong>;(c) <strong>分层检验</strong>。(5) <strong>实验管理(management)</strong>——(a) <strong>元数据</strong>(实验目的、假设、指标、配置);(b) <strong>生命周期</strong>(创建 → 运行 → 分析 → 归档);(c) <strong>权限与审计</strong>;(d) <strong>冲突检测</strong>(同层实验是否冲突);(e) <strong>与特征平台的集成</strong>(实验配置与模型训练一致)。(6) <strong>其他能力</strong>——(a) <strong>switchback / 集群随机化</strong>(支持非用户级随机);(b) <strong>准实验</strong>(合成控制/DiD);(c) <strong>长期 holdout 管理</strong>;(d) <strong>实验的'样本量计算'</strong>(事前);(e) <strong>'早停'的正确处理</strong>(序贯检验)。<strong>与其他问题的关系</strong>——(a) 与'分层实验'(下一题);(b) 与'多重比较'(下一题);(c) 与'样本量计算'(下一题)。<strong>实践建议</strong>——(a) <strong>支持分层与互斥域</strong>(提高实验密度);(b) <strong>CUPED 降方差</strong>(几乎免费);(c) <strong>实时 + 离线双轨</strong>(早停 + 最终);(d) <strong>口径一致</strong>(与业务报表);(e) <strong>元数据与生命周期管理</strong>;(f) <strong>支持非用户级随机</strong>(switchback)。<strong>度量</strong>——(a) 实验密度(同期实验数);(b) 方差降低比例(CUPED);(c) 指标口径一致性;(d) 平台的稳定性与延迟。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'分层实验提高实验密度'</strong>——不同层可复用同一批用户;面试中能指出这一点是深度理解的标志。② <strong>'CUPED 几乎免费地降方差'</strong>——用实验前数据;通常降 30%~50%。③ <strong>'口径一致性'常被忽视</strong>——实验指标与业务报表不一致会导致'实验提升但业务没变'的困惑。④ <strong>'互斥域'处理相互干扰的实验</strong>——如两个都改首页的实验不能同时跑(需互斥)。⑤ <strong>'早停需序贯检验'</strong>——否则会因'偷看数据'而提高假阳性率。⑥ <strong>面试要点</strong>——被问'实验平台要什么能力',应给出'<strong>流量分配(分层/互斥域)+ 指标(实时/离线/口径一致)+ 方差降低(CUPED)+ 多重比较 + 管理(元数据/生命周期)</strong>';能指出'CUPED'与'分层'是深度理解的标志。
⚠️ Common Interview Pitfalls
- ✕不支持分层(实验密度低)
- ✕实验指标与业务报表口径不一致
🎯 Interviewer Follow-ups
- ?什么是'分层实验'(layer)?
- ?CUPED 如何降方差?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.