返回 数理基础 思维导图
中文·English
📐 数理基础ID: causal-inference

因果推断与 Rubin 框架

Causal Inference (Rubin)
🎯核心定义
因果推断 (Causal Inference, Rubin 潜在结果框架) 用反事实定义因果效应: 个体在干预 T=1T=1 与对照 T=0T=0 下的潜在结果分别为 Y(1)Y(1)Y(0)Y(0), 平均处理效应
📌核心概述
ATE=E[Y(1)Y(0)]\text{ATE} = \mathbb{E}[Y(1) - Y(0)];
📌核心概述
观测数据对每个个体只能看到其中一个潜在结果, 因此需在可忽略性 (无混淆) 假设下估计 ATE。
💡使用场景
在线实验不可行或已结束后的效果评估、推荐系统与增长策略的事后归因;面试常考混淆变量 vs 碰撞变量的区别、倾向得分匹配 (PSM) 的完整流程、相关性 ≠ 因果的经典案例。
解决的核心痛点
相关性不等于因果——混淆变量 XX 同时影响 TTYY 会伪造相关性; 而条件在碰撞变量 (collider) 上反而引入选择偏差 (Berkson 悖论);倾向得分 e(x)=P(T=1x)e(x) = P(T=1 \mid x) 把高维协变量压缩成一维平衡分数, PSM 流程: ① logistic 回归拟合 e(x)e(x) ② 按得分匹配或加权 ③ 在匹配样本上估计 ATE^=Yˉ1Yˉ0\hat{\text{ATE}} = \bar{Y}_1 - \bar{Y}_0 ④ 平衡性检验;相比直接对 XX 回归, 倾向得分在协变量维度高、分布重叠不足时对模型误设更稳健。
🎯5 个高频面试考点 (Exam Points)
1
潜在结果框架下 ATE =E[Y(1)Y(0)]= \mathbb{E}[Y(1) - Y(0)] 的定义?为什么观测数据无法直接估计?
2
混淆变量与碰撞变量的区别?控制碰撞变量为什么反而引入偏差?
3
倾向得分 e(x)=P(T=1x)e(x) = P(T=1 \mid x) 的作用与 PSM 的完整四步流程?
4
举一个相关性 ≠ 因果性的例子, 并说明可忽略性 (ignorability) 假设的含义?
5
PSM 相比直接对协变量回归调整的优缺点?如何做平衡性检验?
更新于 2026-08-12
🎯
检验攻克程度:针对「因果推断与 Rubin 框架」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点置信区间下一个知识点逆变换采样

🔗 更多 数理基础 知识点卡片

Adam/AdamW 偏差修正推导贝叶斯推断偏差方差分解Bootstrap