TalentMe
How To
🗺️
AI Industry Map
NEW
Knowledge ▾
Intro & Usage
Machine Learning Repo
Data Science Repo
Resources ▾
Intro & Usage
AI Tech Vault (Tech Wiki)
Industry News
Tech Blogs
Research Papers
Open Source Projects
Tools Hub ▾
🛠️ Tools & Skills Overview
🌐 Interactive Web Tools
🗺️ AI Industry & Career Map
🧭 AI Career Transition Navigator & Roadmap
📚 AI Multi-Module Practice Hub
🎯 AI Skill Assessment
🧠 AI Skills Library
AI Skills & Prompts Overview
Local Agent Guide
Cloud Skills Templates
⚡ MCP Tools Suite
TalentMe MCP Guide
CLI Tools & Commands
Services ▾
🚀 Services & Plans Suite
🧭 1v1 Coaching & Services
💎 Plans & Pricing
💬 Contact & Consultation
Contact Us
💬 Discord
🌐
中
☀️
🔑
Login / Register
☰
技术知识库
›
复习路线图
›
DS 数据科学家 思维导图
›
CUPED 方差缩减严格数学推导
← 返回 DS 数据科学家 思维导图
中文
·
English
📈 DS 数据科学家
ID:
ds-cuped-variance-reduction-derivation
CUPED 方差缩减严格数学推导
CUPED Variance Reduction Derivation
🎯
核心定义
微软提出的大规模受控实验方差缩减技术 CUPED (Controlled-experiment Using Pre-Experiment Data / Deng et al. 2013) 及其最优系数严格数学推导 (CUPED Variance Reduction & Optimal Theta Derivation) 是现代大厂 A/B 实验平台将实验灵敏度提升数倍、将所需样本量或运行天数砍半的“统计核武器”;数学建模:设目标指标为
Y
Y
Y
(实验期指标),寻找一个在实验开始前测量、且
绝对不受实验处理影响
的伴随协变量
X
X
X
(如实验前 7 天的历史同口径指标,满足
E
[
X
T
]
=
E
[
X
C
]
\mathbb{E}[X_T] = \mathbb{E}[X_C]
E
[
X
T
]
=
E
[
X
C
]
);构造无偏调整估计量:
Y
~
=
Y
−
θ
(
X
−
E
[
X
]
)
\tilde{Y} = Y - \theta (X - \mathbb{E}[X])
Y
~
=
Y
−
θ
(
X
−
E
[
X
])
;对其方差展开求导:
Var
(
Y
~
)
=
Var
(
Y
)
+
θ
2
Var
(
X
)
−
2
θ
Cov
(
Y
,
X
)
\text{Var}(\tilde{Y}) = \text{Var}(Y) + \theta^2 \text{Var}(X) - 2\theta \text{Cov}(Y, X)
Var
(
Y
~
)
=
Var
(
Y
)
+
θ
2
Var
(
X
)
−
2
θ
Cov
(
Y
,
X
)
;对
θ
\theta
θ
求导并令一阶导为 0,解出最优回归投影系数:
θ
∗
=
Cov
(
Y
,
X
)
Var
(
X
)
\theta^* = \frac{\text{Cov}(Y, X)}{\text{Var}(X)}
θ
∗
=
Var
(
X
)
Cov
(
Y
,
X
)
;代入后得到缩减后的最小方差:
Var
(
Y
~
∗
)
=
Var
(
Y
)
⋅
(
1
−
ρ
X
Y
2
)
\text{Var}(\tilde{Y}^*) = \text{Var}(Y) \cdot (1 - \rho_{XY}^2)
Var
(
Y
~
∗
)
=
Var
(
Y
)
⋅
(
1
−
ρ
X
Y
2
)
(其中
ρ
X
Y
\rho_{XY}
ρ
X
Y
为
X
X
X
与
Y
Y
Y
的皮尔逊相关系数);当相关性
ρ
=
0.7
\rho = 0.7
ρ
=
0.7
时,方差直接降低
$51\%$
,等价于实验所需样本量缩减一半!
💡
使用场景
顶级大厂(微软、Meta、字节跳动、快手)A/B 实验平台底层核心方差缩减引擎、微小指标增益挖掘。
⚡
解决的核心痛点
很多成熟业务指标提升幅度仅有 0.2%~0.5%,常规 A/B 测试需要跑数月才能达到显著性;CUPED 在不增加任何额外用户流量的前提下,通过消除用户自身固有历史方差,使实验周期缩短 50% 以上。
🎯
5 个高频面试考点 (Exam Points)
1
现场完整书写 CUPED 目标函数方差对
θ
\theta
θ
的求导过程,严格推导出最优解
θ
∗
=
Cov
(
Y
,
X
)
Var
(
X
)
\theta^* = \frac{\text{Cov}(Y, X)}{\text{Var}(X)}
θ
∗
=
Var
(
X
)
Cov
(
Y
,
X
)
与方差缩减比例
(
1
−
ρ
2
)
(1 - \rho^2)
(
1
−
ρ
2
)
?
2
协变量
X
X
X
的强外生性要求:为什么协变量
X
X
X
必须严格在实验上线前采集?如果采集了实验期间的特征作为
X
X
X
会导致什么严重的因果推断灾难(内生性吸收因果效应)?
3
多协变量多元 CUPED 扩展:如何使用 OLS 线性回归
Y
~
=
Y
−
X
β
\tilde{Y} = Y - X \beta
Y
~
=
Y
−
X
β
同时纳入多个历史特征(历史点击、历史留存、用户设备类型)?
4
新用户冷启动无历史数据时的处理:针对实验期间注册的全新用户(无实验前 7 天数据),工程上应如何给其赋默认值(如赋 0 或总体均值
X
ˉ
\bar{X}
X
ˉ
)而不破坏估计无偏性?
5
非线性 CUPED 与 ML 辅助方差缩减 (Machine Learning-Assisted Variance Reduction / XGBoost 预测):如何利用 GBDT 预测
Y
^
=
f
(
X
pre
)
\hat{Y} = f(X_{\text{pre}})
Y
^
=
f
(
X
pre
)
构建残差?
🔗
核心前置底层技术卡片 (点击穿透复习)
📐
[Math]
线性代数与矩阵分解
→
🏗️
[System_Design]
推荐在线 A/B 实验与 Interleaving
→
📖 关联深度指南:
📄 ds-ab-testing-case-studies →
更新于 2026-08-14
🎯
检验攻克程度:针对「CUPED 方差缩减严格数学推导」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题 ➔
← 上一个知识点
Bootstrap 非参数重采样与置信区间
下一个知识点 →
样本比例失衡 SRM 卡方检测排查
🔗 更多 DS 数据科学家 知识点卡片
假设检验、两类错误与功效权衡
样本量公式严格推导与 MDE 估算
P-hacking 偷窥与序贯检验 mSPRT
多重比较校正:Bonferroni vs FDR