M1-085M1: Mathematics & Statistics Fundamentals实验设计 (A/B)Hard
Mastery:
实验设计 (A/B): 解释网络效应/干扰下为什么个体随机化会失效,以及如何应对。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 个体处理会影响他人(溢出),违反 SUTVA;用集群随机化、switchback 或专门的干扰感知设计。
📌 Key Takeaways
- •干扰导致效应被稀释或放大(方向不定)
- •干扰越强,个体随机化的偏差越大
📐 Mathematical Derivations
干扰的机制:标准 A/B 要求 <strong>SUTVA</strong>(个体 i 的结果只依赖自己的处理 Tᵢ),但在以下场景被违反——① <strong>社交网络</strong>:处理组用户的行为会影响其好友(如分享、跟风),使对照组也被'间接处理';② <strong>双边市场</strong>:买家实验改变需求,影响卖家行为与另一侧用户体验;③ <strong>共享资源</strong>:处理组占用更多库存/运力,挤压对照组(如打车平台的补贴实验);④ <strong>竞争/学习</strong>:同一关键词的广告预算实验会互相竞价。<strong>后果</strong>:个体随机化测到的是'直接效应 + 部分溢出效应'的混合——若溢出是<strong>正的</strong>(对照组也受益),则处理效应被<strong>低估</strong>;若是<strong>负的</strong>(对照组被挤压),则被<strong>高估</strong>。且<strong>干扰强度越大、偏差越大</strong>;严重时甚至符号翻转。
🏭 Production Trade-offs
应对策略:① <strong>集群随机化(Cluster Randomization)</strong>——以'无干扰的单元'为随机化单位(如地理区域、社交社区、城市);优点是保留个体层面数据(功效高于 switchback);代价是<strong>有效样本量降为集群数</strong>(集群内相关导致方差膨胀,需用 <strong>ICC(组内相关系数)</strong> 校正:设计效应 = 1+(m−1)·ICC),且集群数需足够(通常 ≥40)。② <strong>Switchback(时间轮换)</strong>——把干扰限制在时间窗内(见上题);适合无法按空间划分的场景。③ <strong>饱和设计(Saturation Design)</strong>——刻意让部分集群的处理比例不同(如 0%、50%、100%),通过对比不同饱和度的集群<strong>估计溢出效应</strong>;这是 Facebook 研究社交影响的标准方法。④ <strong>双向随机化(Bipartite/Two-sided)</strong>——对市场两侧分别随机化并联合分析。⑤ <strong>检测干扰</strong>——比较不同饱和度/集群大小的效应估计(若随饱和度变化则存在干扰);或用'影子对照'(未暴露于任何处理的全隔离组)。⑥ <strong>实践建议</strong>——先评估干扰强度(小规模集群实验),若干扰弱可用个体随机化 + 稳健标准误,若干扰强必须用集群/switchback;且应报告'干扰下的效应解读'(是直接效应还是总体效应)。
⚠️ Common Interview Pitfalls
- ✕在有网络效应的场景用个体随机化
- ✕集群随机化忽略 ICC 导致方差低估
🎯 Interviewer Follow-ups
- ?如何检测干扰的存在?
- ?集群随机化的代价是什么?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.