M2-092M2: Classical Machine LearningLinear RegressionMedium
Mastery:

Linear Regression: 解释加权最小二乘(WLS)与它处理异方差的方式。

📐 Mathematical Definition
min⁡w∑iωi (yi−xi⊤w)2,w^WLS=(X⊤WX)−1X⊤Wy\min_w\sum_i \omega_i\,(y_i-x_i^\top w)^2,\qquad \hat w_{WLS}=(X^\top WX)^{-1}X^\top Wy
⚡ Executive Summary
Core Concept: 给每个样本乘权重再最小化加权残差平方和;权重取方差的倒数时达到最小方差。

📌 Key Takeaways

  • •
    权重 ωᵢ 通常取 1/σᵢ²(方差倒数)
  • •
    异方差下 OLS 仍无偏但非有效

📐 Mathematical Derivations

问题的背景:OLS 假设同方差(Var(εᵢ)=σ²),若违反则 OLS 仍<strong>无偏</strong>但<strong>不再有效</strong>(不是 BLUE),且标准误公式失效。<strong>WLS 的做法</strong>:对每个样本赋予权重 ωᵢ,最小化 Σωᵢ(yᵢ−xᵢᵀw)²,解为 ŵ_WLS=(XᵀWX)⁻¹XᵀWy。<strong>最优权重的推导</strong>:由广义最小二乘(GLS)理论,当 Var(ε)=σ²W⁻¹ 时最优权重 ωᵢ=1/σᵢ²——即<strong>方差越大的观测权重越小</strong>(因为它携带的信息更少)。这符合直觉:噪声大的观测应被'打折'。加权后的估计量达到 Cramér-Rao 下界(在已知方差结构的条件下有效)。<strong>实践中的两阶段法</strong>:σᵢ² 通常未知,可用 (a) 用 OLS 残差建模方差(如假设 Var(εᵢ)∝xᵢ 或 ∝xᵢ²,用残差平方回归估计);(b) 迭代重加权最小二乘(IRLS)。

🏭 Production Trade-offs

实践要点与对比:① <strong>WLS vs 稳健标准误</strong>——两者解决不同问题:WLS 改变<strong>点估计</strong>(更有效),稳健标准误(Huber-White)只修正<strong>推断</strong>(不改变点估计);若只关心正确的 p 值与置信区间,稳健标准误更简单(无需建模方差结构);若关心估计效率(小样本下方差更小),WLS 更好。② <strong>权重结构的假设</strong>——WLS 的收益依赖权重正确;若权重误设,反而可能比 OLS 更差。常见假设:分组数据的组方差 ∝1/组大小、泊松数据的方差 ∝均值(此时 WLS 等价于 Poisson 回归的 IRLS)。③ <strong>与 GLM 的关系</strong>——WLS 是 GLM 的一个特例(Gaussian 分布 + identity 链接 + 已知方差结构);GLM 的 IRLS 算法每步就是一次 WLS。④ <strong>应用场景</strong>——实验数据中不同测量的精度不同(如仪器精度)、聚合数据的组大小不同(组均值回归时权重 ∝ 组大小)、异方差明显的数据。⑤ <strong>陷阱</strong>——用<strong>估计的</strong>权重后,标准误需调整(否则低估);且权重不能为 0 或负(会丢弃/翻转样本)。
⚠️ Common Interview Pitfalls
  • ✕
    异方差下只用 OLS 点估计而不修正推断
  • ✕
    权重误设时仍认为 WLS 必然优于 OLS
🎯 Interviewer Follow-ups
  • ?
    如何估计 σᵢ²?(残差平方的两阶段法)
  • ?
    WLS 与稳健标准误的取舍?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM2-091: Feature Selection: 在神经网络中如何评估特征重要性?与树模型的方法有何不同?📋Back to BankNext →M2-093: Linear Regression: 解释回归中的交互项与多项式项,以及如何避免过拟合。