M1-053M1: Mathematics & Statistics Fundamentals实验设计 (A/B)Medium
Mastery:
实验设计 (A/B): 解释样本比例失配(SRM),如何检测与排查。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 实际分组比例显著偏离预期;用卡方检验检测,通常说明分流/埋点/过滤有 bug。
📌 Key Takeaways
- •SRM 是实验不可信的第一信号
- •常见原因:重定向、bot 过滤、曝光时机差异
📐 Mathematical Derivations
SRM 的检测:设预期分流比例为 p_i(如 50/50),实际观测样本量为 O_i,期望 E_i=p_i·N,则卡方统计量 χ²=Σ(O_i−E_i)²/E_i 在 H₀(分流正确)下服从 χ²(k−1)。实践中 SRM 的判定阈值比常规检验更严格(通常 p<0.001 甚至 p<0.0001),因为分流错误一旦存在就会持续影响所有实验,且会因大样本而轻易达到 p<0.05。<strong>为什么 SRM 是严重信号</strong>:若分流本身有偏,则组间差异可能来自分流偏差而非策略效果,实验结论完全不可信——所以 SRM 是'实验不可信的第一信号',任何解读都应在确认无 SRM 之后进行。
🏭 Production Trade-offs
常见成因与排查:① <strong>分流逻辑</strong>——哈希函数不均匀、盐值(salt)在不同服务间不一致、多层实验的流量冲突;② <strong>埋点与日志</strong>——某组的事件上报丢失(如客户端版本差异)、曝光时机不同(处理组多一次渲染导致曝光计数不同)、日志采样不对称;③ <strong>过滤逻辑</strong>——bot/爬虫过滤规则在两组执行不一致、异常值清洗依赖了组信息、重定向导致用户中途换组;④ <strong>时序</strong>——两组上线时间不同导致覆盖的用户群不同(如处理组先上线,早期用户被排除)。<strong>排查顺序</strong>:先看原始分流日志(是否真的按预期分流)→ 再看埋点与曝光(是否对称)→ 最后检查下游过滤逻辑。发现 SRM 后的正确做法是<strong>废弃该实验并修复基础设施</strong>,而不是'校正'数据。
⚠️ Common Interview Pitfalls
- ✕用 p<0.05 判定 SRM(应更严格,如 p<0.001)
- ✕发现 SRM 后仍强行解读指标差异
🎯 Interviewer Follow-ups
- ?SRM 与指标不显著的混淆风险?
- ?发现 SRM 后应该怎么做?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.