M1-054M1: Mathematics & Statistics Fundamentals实验设计 (A/B)Medium
Mastery:

实验设计 (A/B): 什么是 CUPED?它为什么能降方差。

📐 Mathematical Definition
Ycv=Y−θ(X−Xˉ),θ=Cov(Y,X)Var(X)Y^{cv}=Y-\theta(X-\bar X),\qquad \theta=\frac{\mathrm{Cov}(Y,X)}{\mathrm{Var}(X)}
⚡ Executive Summary
Core Concept: 用实验前协变量(如历史同指标)做回归调整,扣掉可解释方差。

📌 Key Takeaways

  • •
    方差降低比例 ≈ ρ²
  • •
    不引入偏差(协变量与处理独立)
  • •
    是工业界 A/B 的标准降方差手段

📐 Mathematical Derivations

CUPED(Controlled-experiment Using Pre-Experiment Data)的构造:取实验前的协变量 X(通常是同一用户的历史同指标,如实验前 7 天的点击率),构造调整后的指标 Y^cv=Y−θ(X−X̄),其中 θ=Cov(Y,X)/Var(X) 是最优系数。<strong>为什么降方差</strong>:Var(Y^cv)=Var(Y)−Cov(Y,X)²/Var(X)=Var(Y)(1−ρ²),即方差降低比例为<strong>相关系数的平方</strong> ρ²。若历史指标与实验期指标相关系数为 0.7,则方差降低 49%——等效于样本量翻倍。<strong>为什么无偏</strong>:由于随机分流使 X 在两组间分布相同(E[X|T=1]=E[X|T=0]),减去 θ(X−X̄) 不改变两组期望之差,故 ATE 估计仍无偏。

🏭 Production Trade-offs

实践要点:① <strong>协变量的选择</strong>——首选实验前同指标(相关性最高);也可用多个协变量的回归调整(CUPED 的推广,等价于用实验前数据预测实验期指标再取残差);② <strong>前提条件</strong>——协变量必须在随机化<strong>之前</strong>测量(否则可能被处理影响),且与处理独立;实践中还要注意协变量缺失(新用户无历史)时退化为原指标;③ <strong>与其他降方差方法的对比</strong>——分层随机化/后分层(Post-stratification)在离散协变量上有效,CUPED 在连续协变量上更灵活且常更强;两者可叠加;④ <strong>实现的坑</strong>——θ 必须用实验数据估计(可能引入微小偏差,可用样本分割消除)、协变量需做异常值处理(重尾协变量会削弱效果)、新用户群体需单独处理。
⚠️ Common Interview Pitfalls
  • ✕
    用实验期间的数据作为协变量(引入偏差)
  • ✕
    忽略新用户无历史协变量的退化情形
🎯 Interviewer Follow-ups
  • ?
    CUPED 需要什么前提?
  • ?
    与分层抽样/后分层的区别?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM1-053: 实验设计 (A/B): 解释样本比例失配(SRM),如何检测与排查。📋Back to BankNext →M1-055: 实验设计 (A/B): CTR 上升但 CVR 没动,如何用统计方法分析原因。