M7-096M7: Retrieval, Ranking & RecSysOnline Metrics & GuardrailsMedium
Mastery:

Online Metrics & Guardrails: 解释网络效应与干扰(interference)对实验的影响。

📐 Mathematical Definition
SUTVA violated: units interact;fix: cluster randomization, switchback\text{SUTVA violated}:\ \text{units interact};\qquad \text{fix}:\ \text{cluster randomization},\ \text{switchback}
⚡ Executive Summary
Core Concept: 用户间/物品间相互影响(社交、供需、竞争)破坏 SUTVA;需集群随机化、switchback、或预算分割。

📌 Key Takeaways

  • •
    干扰:一个用户的处理影响另一个用户(社交/竞争/供需)
  • •
    后果:A/B 的'处理效应'估计有偏(违反 SUTVA)
  • •
    对策:集群随机化、switchback、预算分割、地理分割

📐 Mathematical Derivations

数学机理:<strong>网络效应与干扰(interference)</strong>——(1) <strong>定义</strong>——A/B 实验假设'一个单元的处理不影响其他单元'(<strong>SUTVA</strong>);但很多场景<strong>违反</strong>:(a) <strong>社交网络</strong>——'给 A 组推荐某内容 → A 组用户分享给 B 组用户 → B 组也受影响';(b) <strong>供需/市场</strong>——'给 A 组展示某商品 → A 组买走库存 → B 组买不到'(<strong>市场均衡效应</strong>);(c) <strong>竞争/拍卖</strong>——'A 组提高出价 → 广告价格上升 → B 组成本上升';(d) <strong>内容生态</strong>——'A 组看某创作者 → 该创作者获得更多曝光 → 影响 B 组看到的内容';(e) <strong>共享资源</strong>——'A 组消耗算力 → B 组延迟上升'。(2) <strong>后果</strong>——(a) <strong>处理效应估计有偏</strong>——'A 组的表现'包含了'对 B 组的溢出'(<strong>spillover</strong>);(b) <strong>方向不确定</strong>——溢出可能是正(社交传播)或负(竞争);(c) <strong>'稀释'效应</strong>——若 A 组占比小,则'对整体的影响'被稀释(但 A/B 只测 A 组 vs B 组);(d) <strong>'均衡效应'</strong>——大规模上线后的效果 ≠ 小流量实验的效果(因为'市场会调整')。(3) <strong>对策</strong>——(a) <strong>集群随机化(cluster randomization)</strong>——把'相互影响的单元'分到同一组(如'同一社交圈的用户分到同一组');<strong>优点</strong>——减少组间干扰;<strong>缺点</strong>——(i) 需知道'谁与谁相互影响';(ii) 有效样本量下降(因为集群内的单元'不独立')。(b) <strong>Switchback 实验</strong>——<strong>时间上交替</strong>(如'第 1 小时用 A、第 2 小时用 B');<strong>适用</strong>——(i) <strong>市场均衡</strong>场景(供需);(ii) 无法按用户分割的场景(如'整个城市的定价');<strong>优点</strong>——避免'组间干扰'(因为同一时间只有一种处理);<strong>缺点</strong>——(i) 需处理'时间趋势'(如'早晚高峰');(ii) 样本量受限(时间点数)。(c) <strong>预算/流量分割</strong>——(i) <strong>地理分割</strong>(不同城市不同策略);(ii) <strong>时间分割</strong>;(iii) <strong>随机化单元上移</strong>(把'市场'作为单元)。(d) <strong>建模干扰</strong>——(a) 显式建模'溢出效应'(如用'邻居的处理状态'作为特征);(b) 用'因果推断的干扰方法'(如'暴露映射')。(e) <strong>'小流量 + 大规模'的差异</strong>——(i) 小流量实验测'局部效应';(ii) 大规模上线有'均衡效应';(iii) <strong>对策</strong>——分阶段放量,观察'效应是否随流量变化'。<strong>与其他问题的关系</strong>——(a) 与'SUTVA'(OPE 的假设);(b) 与'长期效应'(均衡效应需长期观察);(c) 与'实验平台'(需支持集群/switchback)。<strong>实践建议</strong>——(a) <strong>先判断是否有干扰</strong>(社交/供需/竞争);(b) <strong>有干扰 → 集群随机化或 switchback</strong>;(c) <strong>地理/时间分割</strong>(市场均衡);(d) <strong>建模溢出</strong>(显式);(e) <strong>分阶段放量</strong>(观察效应随流量的变化);(f) <strong>报告'有效样本量'</strong>(集群随机化会降低)。<strong>度量</strong>——(a) 溢出效应的估计;(b) 分阶段放量的效应变化;(c) 集群内的相关性(ICC);(d) 有效样本量。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>'干扰违反 SUTVA'是核心</strong>——面试中能指出'社交/供需/竞争'三类场景是深度理解的标志。② <strong>'Switchback 适合市场均衡'</strong>——时间上交替(同一时间只有一种处理);这是'无法按用户分割'时的解法。③ <strong>'集群随机化降低有效样本量'</strong>——因为集群内单元不独立(ICC);故需更大样本。④ <strong>'均衡效应使小流量与大规模不一致'</strong>——需分阶段放量观察。⑤ <strong>'建模溢出'是高级手段</strong>——显式建模'邻居的处理状态'。⑥ <strong>面试要点</strong>——被问'什么场景不能直接 A/B',应给出'<strong>社交/供需/竞争三类干扰 + 对策(集群随机化/switchback/地理分割/建模溢出)+ 分阶段放量</strong>';能指出'Switchback 适合市场均衡'是深度理解的标志。
⚠️ Common Interview Pitfalls
  • ✕
    在强干扰场景直接按用户随机(估计有偏)
  • ✕
    小流量实验的效应直接外推到全量(均衡效应)
🎯 Interviewer Follow-ups
  • ?
    哪些场景有强干扰?
  • ?
    什么是 switchback 实验?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM7-095: Online Metrics & Guardrails: 解释搜索/推荐中的位置偏置对在线指标的影响。📋Back to BankNext →M7-097: Online Metrics & Guardrails: 解释长期效应评估的方法。