M1-088M1: Mathematics & Statistics FundamentalsCausal InferenceMedium
Mastery:
Causal Inference: 解释断点回归(RDD)与它的关键假设。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 利用某个连续变量在阈值处的'跳跃'识别因果;关键假设是阈值附近个体除处理外无系统性差异。
📌 Key Takeaways
- •阈值 c 处处理状态发生跳变
- •只识别阈值附近的局部效应(LATE at cutoff)
- •需检验协变量在阈值处是否连续
📐 Mathematical Derivations
RDD 的核心思想:当处理由某连续变量 X 是否越过阈值 c 决定时(如'考试分数 ≥60 分才录取'、'年龄 ≥65 岁才领养老金'),比较<strong>阈值两侧</strong>个体的结果差异即可识别因果效应——因为在阈值附近,个体除'是否越过阈值'外几乎相同(近似随机化)。<strong>统计量</strong>:τ=lim_{x↓c}E[Y|X=x]−lim_{x↑c}E[Y|X=x],即阈值处的<strong>跳跃幅度</strong>。<strong>关键假设</strong>:① <strong>连续性</strong>——若无处理,E[Y|X] 在阈值处连续(即除处理外没有其他因素在阈值处跳变);② <strong>无操纵(no manipulation)</strong>——个体不能精确控制 X 使其恰好落在阈值一侧(如不能精确改分数);③ <strong>阈值附近</strong>的个体是可比的。<strong>识别的是局部效应</strong>——只对'阈值附近的依从者'有效(LATE at cutoff),不能外推到远离阈值的个体(如不能从'60 分录取'推断'90 分录取'的效果)。
🏭 Production Trade-offs
实践要点:① <strong>检验假设</strong>——(a) <strong>协变量连续性</strong>:检验其他协变量(性别、年龄、背景)在阈值处是否连续(若不连续说明存在操纵或混杂);(b) <strong>操纵检验(McCrary 检验)</strong>:检查 X 的密度在阈值处是否有跳跃(个体聚集在阈值一侧说明可能操纵);(c) <strong>带宽敏感性</strong>:用不同带宽(bandwidth)估计,结果应稳健。② <strong>估计方法</strong>——用<strong>局部线性回归</strong>(在阈值两侧分别拟合,取阈值处的截距差),而非全局多项式(高次多项式在边界外推不稳定,Gelman & Imbens 建议避免);带宽可用 Imbens-Kalyanaraman 或 Calonico 等最优带宽选择器。③ <strong>模糊 RDD(Fuzzy RDD)</strong>——若越过阈值只是<strong>提高</strong>处理概率而非完全决定(如'60 分以上才可申请'),则用阈值作为<strong>工具变量</strong>(2SLS)估计,此时识别的是依从者的效应——这是 RDD 与 IV 的结合。④ <strong>应用实例</strong>——教育(班级规模、奖学金)、公共政策(养老金、医保资格)、平台规则(信用分阈值、推荐位门槛);实践中电商的'满减门槛'、'免运费门槛'都是天然 RDD 场景。⑤ <strong>局限</strong>——只能评估阈值附近的效应、需要大样本(阈值附近的样本量受限)、对带宽选择敏感。
⚠️ Common Interview Pitfalls
- ✕用全局高次多项式拟合 RDD(边界不稳定)
- ✕把阈值附近的局部效应外推到全体
🎯 Interviewer Follow-ups
- ?RDD 与 IV 的关系?
- ?如何检验操纵(manipulation)?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.