M1-058M1: Mathematics & Statistics FundamentalsCausal InferenceMedium
Mastery:

Causal Inference: 解释倾向得分匹配(PSM)与逆概率加权(IPW)。

📐 Mathematical Definition
IPW: τ^=1n∑[TiYie(Xi)−(1−Ti)Yi1−e(Xi)]\mathrm{IPW}:\ \hat\tau=\frac1n\sum\Big[\frac{T_iY_i}{e(X_i)}-\frac{(1-T_i)Y_i}{1-e(X_i)}\Big]
⚡ Executive Summary
Core Concept: PSM 用倾向得分匹配相似样本;IPW 用 1/倾向得分重加权,构造伪随机化总体。

📌 Key Takeaways

  • •
    倾向得分 e(X)=P(T=1|X)
  • •
    重叠性假设:0<e(X)<1
  • •
    IPW 对倾向得分模型误设敏感

📐 Mathematical Derivations

<strong>倾向得分</strong> e(X)=P(T=1|X) 是'在给定协变量下接受处理的概率',它把高维协变量压缩为一维——这是 Rosenbaum & Rubin (1983) 的核心定理:若控制 X 后处理可忽略,则控制 e(X) 同样可忽略。<strong>PSM</strong> 通过匹配倾向得分相近的处理/对照个体来构造可比组,直观但丢弃未匹配样本且匹配质量难控。<strong>IPW</strong> 的思路完全不同:给每个观测赋予权重 1/e(X)(处理组)或 1/(1−e(X))(对照组),使得加权后的样本在协变量分布上<strong>模拟随机化</strong>——直觉是'倾向得分低却接受了处理的人代表了很多没被处理的人,故应放大其权重'。IPW 估计量可写为加权均值差,且有两组正确性条件:倾向得分模型正确,或结果模型正确(后者对应 DR)。

🏭 Production Trade-offs

实践要点:① <strong>假设与诊断</strong>——需满足<strong>条件可忽略性</strong>(无未观测混淆,不可检验)、<strong>重叠性/正性</strong>(0<e(X)<1,即每个个体都有机会接受两种处理)、<strong>SUTVA</strong>。诊断手段:检查倾向得分的重叠区域(画两组的 e(X) 分布)、用标准化偏差(standardized bias)检查加权/匹配后的协变量平衡、检查有效样本量(ESS)。② <strong>IPW 的方差问题</strong>——权重可能极大(当 e(X)→0 或 1 时),导致方差爆炸;缓解手段是<strong>稳定化权重</strong>(乘以边际处理概率,SNIPS)、<strong>权重截断</strong>(trimming,如限制到 99 分位)、或用 <strong>overlap weights</strong>(一种自带降方差性质且不需截断的加权方案)。③ <strong>PSM 的常见误用</strong>——只匹配倾向得分而不检查协变量平衡、用匹配后样本直接做 t 检验(未考虑匹配的不确定性)、丢弃大量样本导致外部效度下降(估的是 ATT 而非 ATE)。④ <strong>PSM vs IPW 选择</strong>——IPW 用全部样本、理论基础更清晰(可推导渐近方差)、更易扩展(DR、TMLE),现代实践中更受推荐。
⚠️ Common Interview Pitfalls
  • ✕
    只匹配倾向得分但不检查协变量平衡
  • ✕
    忽视重叠性假设(e(X) 接近 0 或 1 时权重爆炸)
🎯 Interviewer Follow-ups
  • ?
    IPW 方差很大怎么办?(稳定化权重/trimming)
  • ?
    双重稳健(DR)为什么更稳?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM1-057: Causal Inference: 解释混淆变量、中介变量与对撞变量,以及各自该不该控制。📋Back to BankNext →M1-059: Causal Inference: 解释双重差分(DID)与它的关键假设。