M1-057M1: Mathematics & Statistics FundamentalsCausal InferenceEasy
Mastery:

Causal Inference: 解释混淆变量、中介变量与对撞变量,以及各自该不该控制。

📐 Mathematical Definition
confounder:X→T, X→Y;collider:T→X←Y\text{confounder}: X\to T,\ X\to Y;\quad \text{collider}: T\to X\leftarrow Y
⚡ Executive Summary
Core Concept: 混淆需控制(否则有偏);中介不应控制(会屏蔽效应);对撞控制会引入选择偏差。

📌 Key Takeaways

  • •
    用 DAG 判断该控制什么(后门准则)
  • •
    对撞偏差 = 条件化后制造出虚假相关(Berkson 悖论)

📐 Mathematical Derivations

三类变量按 DAG 结构区分,控制策略完全相反:① <strong>混淆变量(confounder)</strong>——同时影响处理 T 与结果 Y(X→T, X→Y),产生<strong>伪相关</strong>。必须控制,否则把 X 的效应误归给 T。后门准则给出系统判据:控制所有'从 T 到 Y 的后门路径'上的变量。② <strong>中介变量(mediator)</strong>——位于因果链中间(T→M→Y),承载部分因果效应。<strong>不应控制</strong>:控制它会阻断该路径,得到的是'直接效应'而非'总效应',从而<strong>低估</strong>总效应。若研究目的就是分解直接/间接效应,则需专门的中介分析而非简单控制。③ <strong>对撞变量(collider)</strong>——同时被 T 与 Y 影响(T→C←Y)。<strong>不应控制</strong>:控制它会在 T 与 Y 之间<strong>制造</strong>虚假关联(对撞偏差 / collider bias / Berkson 悖论)。经典例子:录取 C 由天赋 X 与努力 Y 共同决定(X→C←Y),在录取者中控制 C 会得到'天赋与努力负相关'的虚假结论。

🏭 Production Trade-offs

实践要点:① <strong>先画 DAG 再决定控制什么</strong>——这是避免错误控制的最有效方法;仅凭'相关性'或'常识'选控制变量极易犯两类错误(漏控混淆、误控对撞)。② <strong>中介分析的三种效应</strong>——总效应(不控制 M)、直接效应(控制 M)、间接效应(总−直接);近年因果推断强调<strong>不要对中介做条件化</strong>,而应用 mediation analysis 或 path-specific effects。③ <strong>对撞偏差的隐蔽性</strong>——它常在'看起来合理'的控制中发生,如按'是否住院'分层研究疾病(住院是疾病与就医行为的对撞)、按'是否点击'分层分析广告效果(点击是广告与用户兴趣的对撞)。④ <strong>M-bias 与工具变量</strong>——更复杂的情形是变量同时是混淆与对撞(M-bias),或存在未观测混淆时需用工具变量/断点回归等设计。
⚠️ Common Interview Pitfalls
  • ✕
    为了'控制得更多'而误控对撞变量
  • ✕
    控制中介后把直接效应当总效应报告
🎯 Interviewer Follow-ups
  • ?
    为什么控制中介会低估总效应?
  • ?
    对撞偏差的经典例子?(天赋→录取←努力)
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM1-056: Causal Inference: 定义因果效应与潜在结果框架(Rubin causal model)。📋Back to BankNext →M1-058: Causal Inference: 解释倾向得分匹配(PSM)与逆概率加权(IPW)。