M1-054M1: Mathematics & Statistics Fundamentals实验设计 (A/B)Medium
Mastery:
实验设计 (A/B): 什么是 CUPED?它为什么能降方差。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 用实验前协变量(如历史同指标)做回归调整,扣掉可解释方差。
📌 Key Takeaways
- •方差降低比例 ≈ ρ²
- •不引入偏差(协变量与处理独立)
- •是工业界 A/B 的标准降方差手段
📐 Mathematical Derivations
CUPED(Controlled-experiment Using Pre-Experiment Data)的构造:取实验前的协变量 X(通常是同一用户的历史同指标,如实验前 7 天的点击率),构造调整后的指标 Y^cv=Y−θ(X−X̄),其中 θ=Cov(Y,X)/Var(X) 是最优系数。<strong>为什么降方差</strong>:Var(Y^cv)=Var(Y)−Cov(Y,X)²/Var(X)=Var(Y)(1−ρ²),即方差降低比例为<strong>相关系数的平方</strong> ρ²。若历史指标与实验期指标相关系数为 0.7,则方差降低 49%——等效于样本量翻倍。<strong>为什么无偏</strong>:由于随机分流使 X 在两组间分布相同(E[X|T=1]=E[X|T=0]),减去 θ(X−X̄) 不改变两组期望之差,故 ATE 估计仍无偏。
🏭 Production Trade-offs
实践要点:① <strong>协变量的选择</strong>——首选实验前同指标(相关性最高);也可用多个协变量的回归调整(CUPED 的推广,等价于用实验前数据预测实验期指标再取残差);② <strong>前提条件</strong>——协变量必须在随机化<strong>之前</strong>测量(否则可能被处理影响),且与处理独立;实践中还要注意协变量缺失(新用户无历史)时退化为原指标;③ <strong>与其他降方差方法的对比</strong>——分层随机化/后分层(Post-stratification)在离散协变量上有效,CUPED 在连续协变量上更灵活且常更强;两者可叠加;④ <strong>实现的坑</strong>——θ 必须用实验数据估计(可能引入微小偏差,可用样本分割消除)、协变量需做异常值处理(重尾协变量会削弱效果)、新用户群体需单独处理。
⚠️ Common Interview Pitfalls
- ✕用实验期间的数据作为协变量(引入偏差)
- ✕忽略新用户无历史协变量的退化情形
🎯 Interviewer Follow-ups
- ?CUPED 需要什么前提?
- ?与分层抽样/后分层的区别?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.