M1-058M1: Mathematics & Statistics FundamentalsCausal InferenceMedium
Mastery:
Causal Inference: 解释倾向得分匹配(PSM)与逆概率加权(IPW)。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: PSM 用倾向得分匹配相似样本;IPW 用 1/倾向得分重加权,构造伪随机化总体。
📌 Key Takeaways
- •倾向得分 e(X)=P(T=1|X)
- •重叠性假设:0<e(X)<1
- •IPW 对倾向得分模型误设敏感
📐 Mathematical Derivations
<strong>倾向得分</strong> e(X)=P(T=1|X) 是'在给定协变量下接受处理的概率',它把高维协变量压缩为一维——这是 Rosenbaum & Rubin (1983) 的核心定理:若控制 X 后处理可忽略,则控制 e(X) 同样可忽略。<strong>PSM</strong> 通过匹配倾向得分相近的处理/对照个体来构造可比组,直观但丢弃未匹配样本且匹配质量难控。<strong>IPW</strong> 的思路完全不同:给每个观测赋予权重 1/e(X)(处理组)或 1/(1−e(X))(对照组),使得加权后的样本在协变量分布上<strong>模拟随机化</strong>——直觉是'倾向得分低却接受了处理的人代表了很多没被处理的人,故应放大其权重'。IPW 估计量可写为加权均值差,且有两组正确性条件:倾向得分模型正确,或结果模型正确(后者对应 DR)。
🏭 Production Trade-offs
实践要点:① <strong>假设与诊断</strong>——需满足<strong>条件可忽略性</strong>(无未观测混淆,不可检验)、<strong>重叠性/正性</strong>(0<e(X)<1,即每个个体都有机会接受两种处理)、<strong>SUTVA</strong>。诊断手段:检查倾向得分的重叠区域(画两组的 e(X) 分布)、用标准化偏差(standardized bias)检查加权/匹配后的协变量平衡、检查有效样本量(ESS)。② <strong>IPW 的方差问题</strong>——权重可能极大(当 e(X)→0 或 1 时),导致方差爆炸;缓解手段是<strong>稳定化权重</strong>(乘以边际处理概率,SNIPS)、<strong>权重截断</strong>(trimming,如限制到 99 分位)、或用 <strong>overlap weights</strong>(一种自带降方差性质且不需截断的加权方案)。③ <strong>PSM 的常见误用</strong>——只匹配倾向得分而不检查协变量平衡、用匹配后样本直接做 t 检验(未考虑匹配的不确定性)、丢弃大量样本导致外部效度下降(估的是 ATT 而非 ATE)。④ <strong>PSM vs IPW 选择</strong>——IPW 用全部样本、理论基础更清晰(可推导渐近方差)、更易扩展(DR、TMLE),现代实践中更受推荐。
⚠️ Common Interview Pitfalls
- ✕只匹配倾向得分但不检查协变量平衡
- ✕忽视重叠性假设(e(X) 接近 0 或 1 时权重爆炸)
🎯 Interviewer Follow-ups
- ?IPW 方差很大怎么办?(稳定化权重/trimming)
- ?双重稳健(DR)为什么更稳?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.