M2-002M2: Classical Machine LearningLinear RegressionEasy
Mastery:
Linear Regression: 列举线性回归的四大假设,并说明违反后果。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 线性、误差独立、同方差、误差正态(用于推断)。
📌 Key Takeaways
- •异方差 → 标准误错,需稳健标准误
- •自相关 → 时间序列需 GLS/Newey-West
- •非线性 → 加特征/样条/树模型
📐 Mathematical Derivations
四大假设及违反后果:① <strong>线性性</strong>(E[y|X]=Xw)——违反则模型系统性偏差,解法是加多项式/交互项、样条、或改用树/神经网络;② <strong>误差独立</strong>——违反(时间自相关、空间相关、聚类)会使标准误被低估、t 检验过于乐观,解法是 GLS、Newey-West 稳健标准误、或聚类稳健标准误;③ <strong>同方差</strong>(Var(ε)=σ² 常数)——违反时 OLS 仍无偏但<strong>不再有效</strong>(不是 BLUE),且标准误公式失效,解法是加权最小二乘(WLS)、稳健标准误、或对 y 做变换(如 log);④ <strong>误差正态</strong>——只影响<strong>小样本推断</strong>(t/F 检验的精确性),大样本下由 CLT 保证推断有效,故这条最不关键。
🏭 Production Trade-offs
诊断与处理的对应:① <strong>异方差诊断</strong>——画残差 vs 拟合值图(应无漏斗形)、Breusch-Pagan / White 检验;处理首选<strong>稳健标准误</strong>(Huber-White),因为它不改变点估计只修正推断,比变换更少假设;② <strong>自相关诊断</strong>——Durbin-Watson 统计量、残差 ACF 图;时间序列应用 ARIMA/GLS 而非普通 OLS;③ <strong>非线性诊断</strong>——残差 vs 特征图(应无系统模式)、RESET 检验;④ <strong>正态性诊断</strong>——QQ 图、Shapiro-Wilk(小样本);违反时用 bootstrap 推断而非 t 检验。实践中一个常见误区是<strong>先做变换再看诊断</strong>——正确顺序是先诊断再决定是否变换,且变换会改变系数的解释(log 变换后系数是弹性)。
⚠️ Common Interview Pitfalls
- ✕认为 OLS 只在正态误差下才有效(大样本靠 CLT)
- ✕异方差下仍用普通标准误做检验
🎯 Interviewer Follow-ups
- ?如何诊断异方差?(残差图/Breusch-Pagan)
- ?多重共线性如何影响系数与 p 值?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.