M1-062M1: Mathematics & Statistics FundamentalsProbability FoundationsMedium
Mastery:

Probability Foundations: 什么是条件期望与全期望公式(塔性质)?它在机器学习中如何应用?

📐 Mathematical Definition
\mathbb E[Y]=\mathbb E\big[\mathbb E[Y\mid X]\big],\qquad \mathbb E[Y\mid Z]=\mathbb E\big[\mathbb E[Y\mid X,Z]\big\mid Z\big]
⚡ Executive Summary
Core Concept: E[Y]=E[E[Y|X]];先按 X 分组求期望再对 X 求期望,是分层/边缘化的核心工具。

📌 Key Takeaways

  • •
    塔性质:对任意可测函数 g 有 E[E[Y|X]|Z]=E[Y|Z](若 Z 是 X 的函数)
  • •
    E[Y|X] 本身是随机变量(X 的函数)

📐 Mathematical Derivations

条件期望 E[Y|X] 是 <strong>X 的函数</strong>(记作 g(X)),因此它本身是一个<strong>随机变量</strong>——这是初学者最容易困惑的点:E[Y|X=x] 是一个数,而 E[Y|X] 是随 x 变化的随机变量。<strong>全期望公式(塔性质)</strong> E[Y]=E[E[Y|X]] 的含义是'先按 X 分层求期望,再对 X 的分布求期望',即<strong>分层加权平均</strong>。证明很直接:E[E[Y|X]]=∫E[Y|X=x]f_X(x)dx=∫∫y f_{Y|X}(y|x)dy f_X(x)dx=∫∫y f_{X,Y}(x,y)dydx=E[Y]。<strong>全方差公式</strong>是它的推广:Var(Y)=E[Var(Y|X)]+Var(E[Y|X])——总方差 = 组内方差的期望 + 组间方差。这个分解是<strong>方差分析(ANOVA)</strong> 与<strong>混合模型</strong>的基础。

🏭 Production Trade-offs

机器学习中的应用:① <strong>EM 算法</strong>——E 步本质是计算隐变量条件下的期望(E[log p(x,z|θ)|x,θᵗ]),塔性质保证了每轮迭代的单调性;② <strong>变分推断</strong>——ELBO 的推导依赖对隐变量取条件期望;③ <strong>因果推断</strong>——调整公式(adjustment formula)E[Y|do(T=t)]=E_X[E[Y|T=t,X]] 就是塔性质在因果识别中的应用(先在各协变量层内求条件效应,再按 X 的分布加权);④ <strong>分层实验与 CUPED</strong>——分层估计量 = Σ(层权重 × 层内均值差),本质是塔性质;⑤ <strong>强化学习</strong>——Bellman 方程 V(s)=E[R+γV(s')] 也是条件期望的递归形式。⑥ <strong>蒙特卡洛估计</strong>——若直接采样 Y 困难,可先采 X 再在 X 条件下采 Y(分层采样),能显著降方差——这是<strong>Rao-Blackwell 化</strong>的思想。
⚠️ Common Interview Pitfalls
  • ✕
    把 E[Y|X] 当作常数而非随机变量
  • ✕
    混淆全期望公式与全方差公式
🎯 Interviewer Follow-ups
  • ?
    为什么 E[Y|X] 是随机变量?
  • ?
    全方差公式与它有什么关系?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM1-061: Probability Foundations: 解释协方差与相关系数,相关系数为 0 是否意味着独立?📋Back to BankNext →M1-063: Common Distributions: 解释对数正态分布与它的适用场景。