M2-002M2: Classical Machine LearningLinear RegressionEasy
Mastery:

Linear Regression: 列举线性回归的四大假设,并说明违反后果。

📐 Mathematical Definition
y=Xw+ε,E[ε]=0, Var(ε)=σ2Iy=Xw+\varepsilon,\quad \mathbb E[\varepsilon]=0,\ \mathrm{Var}(\varepsilon)=\sigma^2I
⚡ Executive Summary
Core Concept: 线性、误差独立、同方差、误差正态(用于推断)。

📌 Key Takeaways

  • •
    异方差 → 标准误错,需稳健标准误
  • •
    自相关 → 时间序列需 GLS/Newey-West
  • •
    非线性 → 加特征/样条/树模型

📐 Mathematical Derivations

四大假设及违反后果:① <strong>线性性</strong>(E[y|X]=Xw)——违反则模型系统性偏差,解法是加多项式/交互项、样条、或改用树/神经网络;② <strong>误差独立</strong>——违反(时间自相关、空间相关、聚类)会使标准误被低估、t 检验过于乐观,解法是 GLS、Newey-West 稳健标准误、或聚类稳健标准误;③ <strong>同方差</strong>(Var(ε)=σ² 常数)——违反时 OLS 仍无偏但<strong>不再有效</strong>(不是 BLUE),且标准误公式失效,解法是加权最小二乘(WLS)、稳健标准误、或对 y 做变换(如 log);④ <strong>误差正态</strong>——只影响<strong>小样本推断</strong>(t/F 检验的精确性),大样本下由 CLT 保证推断有效,故这条最不关键。

🏭 Production Trade-offs

诊断与处理的对应:① <strong>异方差诊断</strong>——画残差 vs 拟合值图(应无漏斗形)、Breusch-Pagan / White 检验;处理首选<strong>稳健标准误</strong>(Huber-White),因为它不改变点估计只修正推断,比变换更少假设;② <strong>自相关诊断</strong>——Durbin-Watson 统计量、残差 ACF 图;时间序列应用 ARIMA/GLS 而非普通 OLS;③ <strong>非线性诊断</strong>——残差 vs 特征图(应无系统模式)、RESET 检验;④ <strong>正态性诊断</strong>——QQ 图、Shapiro-Wilk(小样本);违反时用 bootstrap 推断而非 t 检验。实践中一个常见误区是<strong>先做变换再看诊断</strong>——正确顺序是先诊断再决定是否变换,且变换会改变系数的解释(log 变换后系数是弹性)。
⚠️ Common Interview Pitfalls
  • ✕
    认为 OLS 只在正态误差下才有效(大样本靠 CLT)
  • ✕
    异方差下仍用普通标准误做检验
🎯 Interviewer Follow-ups
  • ?
    如何诊断异方差?(残差图/Breusch-Pagan)
  • ?
    多重共线性如何影响系数与 p 值?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM2-001: Linear Regression: 写出线性回归的闭式解,并说明它成立的前提。📋Back to BankNext →M2-003: Linear Regression: 解释多重共线性,它如何影响系数估计与显著性检验。