M1-051M1: Mathematics & Statistics Fundamentals实验设计 (A/B)Easy
Mastery:
实验设计 (A/B): 描述一个标准 A/B 实验的完整流程。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 定假设与指标 → 功效分析与样本量 → 随机分流 → 运行固定时长 → 校验分流 → 统计检验 → 决策与复盘。
📌 Key Takeaways
- •分流单元要与干扰边界一致(用户级 vs 会话级)
- •必须预先注册主指标,防 p-hacking
📐 Mathematical Derivations
七个阶段的要点:① <strong>定假设与指标</strong>——明确可检验的假设(H₁ 是什么)、指定唯一 primary metric 与若干护栏指标,并预注册分析计划(防 p-hacking 与 HARKing);② <strong>功效分析</strong>——按 MDE、α=0.05、power=0.8 反解样本量与实验时长(注意日活限制:若日活 10 万、需 50 万样本,则至少 5 天);③ <strong>随机分流</strong>——用哈希(如 hash(user_id+salt) % 100)保证<strong>确定性与均匀性</strong>,分流单元需与干扰边界一致(有社交/库存干扰时用集群随机化);④ <strong>运行</strong>——固定时长(避免 peeking),覆盖完整周周期(消除工作日/周末差异);⑤ <strong>校验</strong>——做 <strong>A/A 检验</strong>与 <strong>SRM 检验</strong>(样本比例失配),确认分流无偏;⑥ <strong>统计检验</strong>——按预注册方法(t 检验/序贯检验/CUPED)计算效应量与 CI;⑦ <strong>决策与复盘</strong>——结合业务显著性、护栏指标与长期影响做决策,记录结论与后续实验。
🏭 Production Trade-offs
最易被忽视的三点:① <strong>SUTVA(无干扰假设)</strong>——标准 A/B 要求一个个体的结果不受其他个体处理分配的影响。但在社交网络(好友互相影响)、双边市场(买卖双方)、共享资源(库存/运力)中该假设被违反,处理组会'污染'对照组,导致效应被低估或高估。解法是集群随机化(按地理/社区分组)、switchback(时间轮换)、或专门的干扰感知设计。② <strong>指标的口径与延迟</strong>——转化/退款类指标有延迟,若实验期太短会低估效应;应确保观测窗口覆盖完整的转化周期,或使用代理指标并做延迟校正。③ <strong>多重比较与选择性报告</strong>——若同时看 20 个指标并只报告显著的,假阳性率极高;正确做法是预注册唯一主指标,其余作为探索性分析并明确标注。
⚠️ Common Interview Pitfalls
- ✕未做 SRM/A/A 校验就解读结果
- ✕在存在网络效应的场景用个体级随机化
🎯 Interviewer Follow-ups
- ?为什么要在实验前注册指标?
- ?网络效应/溢出效应会怎样破坏 A/B?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.