返回 DS 数据科学家 思维导图
中文·English
📈 DS 数据科学家ID: ds-propensity-score-matching-doubly-robust

倾向得分 PSM 与双重稳健估计器

PSM Matching & Doubly Robust Estimator
🎯核心定义
倾向得分匹配 (Propensity Score Matching, PSM / Rosenbaum & Rubin 提出)、逆概率加权 (IPW) 与双重稳健估计器 (Doubly Robust Estimator / AIPW) 是在大规模用户观测数据中平衡高维协变量分布、消除选择偏差 (Selection Bias) 的最经典因果推断工具箱;核心思想:倾向得分定义为在给定观测特征 XX 下个体接受处理的条件概率:e(X)=P(T=1X)e(X) = P(T=1 | X)(通常用 Logistic 回归或 GBDT 估计);Rosenbaum-Rubin 定理证明:在强可忽略性假设下,条件化标量倾向得分 $e(X)$ 等价于条件化全量高维协变量 $X$,将高维维数灾难压缩为一维标量匹配;匹配方法包括近邻匹配 (Nearest Neighbor)、卡尺匹配 (Caliper) 与共同支撑域 (Common Support) 裁剪;双重稳健估计器 (AIPW: Augmented IPW) 结合了倾向得分模型与结果回归模型,只要两个模型中任意一个被正确设定,因果效应估计量就依然保持一致与无偏(具备双保险稳健性)。
💡使用场景
无法做 A/B 实验的存量功能(如购买了 VIP 会员的用户)真实因果增益分析、用户流失召回活动归因。
解决的核心痛点
买了会员的用户自然留存率本来就高(混杂特征选择偏差),直接对比会导致会员价值被严重夸大;PSM 与 AIPW 通过为每个会员匹配一个特征几乎一致的非会员,还原真实因果 Lift。
🎯5 个高频面试考点 (Exam Points)
1
详细证明 Rosenbaum-Rubin 降维定理:为什么在 Y(0),Y(1)TXY(0), Y(1) \perp T \mid X 成立时,必有 Y(0),Y(1)Te(X)Y(0), Y(1) \perp T \mid e(X)
2
写出逆概率加权 (IPW: τ^IPW=1n[TiYie(Xi)(1Ti)Yi1e(Xi)]\hat{\tau}_{\text{IPW}} = \frac{1}{n} \sum \left[ \frac{T_i Y_i}{e(X_i)} - \frac{(1-T_i)Y_i}{1-e(X_i)} \right]) 公式,并分析为什么当 e(X)0e(X) \to 011 时方差会发生剧烈爆炸?
3
写出双重稳健估计器 (Augmented IPW / AIPW) 的完整代数形式,并证明其“双重保险 (Double Robustness)”的数学无偏性机制?
4
共同支撑域 (Common Support / Overlap): 如何通过直方图检查倾向得分分布重叠,并剔除离群极端样本以防外推风险?
5
协变量平衡性检验 (Covariate Balance Check): 为什么匹配完成后必须计算标准化均值差 (SMD: Standardized Mean Difference <0.1< 0.1) 而不是看 tt 检验 pp 值?
更新于 2026-08-14
🎯
检验攻克程度:针对「倾向得分 PSM 与双重稳健估计器」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点合成控制法 SCM 与安慰剂空间检验下一个知识点工具变量法 IV 与两阶段回归 2SLS

🔗 更多 DS 数据科学家 知识点卡片

假设检验、两类错误与功效权衡样本量公式严格推导与 MDE 估算P-hacking 偷窥与序贯检验 mSPRT多重比较校正:Bonferroni vs FDR