M1-052M1: Mathematics & Statistics Fundamentals实验设计 (A/B)Easy
Mastery:
实验设计 (A/B): 什么是 A/A 测试?它的作用是什么。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 两组都跑原策略;用于验证分流系统与统计管线,应得到无显著差异。
📌 Key Takeaways
- •上线前跑 A/A 校验分流均匀性与方差估计
- •若 A/A 频繁显著 → 分流或统计有问题
📐 Mathematical Derivations
A/A 测试把两组都分配到<strong>相同</strong>的策略(原策略),因此理论上任何观测到的差异都来自随机噪声。它的用途是<strong>验证实验基础设施的正确性</strong>,具体检查四项:① 分流是否均匀(组间样本量、用户特征分布);② 指标计算管线是否正确(同样的数据两条路径应给出一致结果);③ 方差估计是否准确(A/A 的假阳性率应接近名义 α=5%);④ 是否存在系统性偏差(如缓存、日志丢失、埋点差异导致的不对称)。<strong>判读标准</strong>:单个 A/A 测试的 p 值应服从均匀分布 U(0,1);若在多个 A/A 测试中显著比例远高于 5%,说明基础设施有问题。
🏭 Production Trade-offs
实践要点:① <strong>上线前必做</strong>——新实验平台/新指标/新分流逻辑上线前应跑 A/A 验证,这是防止'实验结果不可信'的第一道防线;② <strong>A/A 显著的可能原因</strong>——分流不均匀(哈希碰撞、过滤逻辑不对称)、埋点丢失(某组日志缺失)、缓存污染(CDN 缓存跨组)、时序偏差(分组上线时间不同)、方差低估(未考虑聚类结构);③ <strong>A/A 的局限</strong>——A/A 只能检测<strong>对称</strong>的系统性偏差,若两组都有同样的偏差(如整体日志丢失),A/A 无法发现;④ 实践中常用 <strong>A/A/A</strong>(三组)以更好地估计方差,或使用<strong>样本分割验证</strong>(把同一处理的数据随机分成两半,检查是否一致)。
⚠️ Common Interview Pitfalls
- ✕跳过 A/A 直接跑 A/B(基础设施问题会被误读为策略效果)
- ✕认为 A/A 不显著就证明基础设施完全正确
🎯 Interviewer Follow-ups
- ?A/A 显著说明什么?
- ?如何诊断分流不均?(SRM 检验)
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.