M2-005M2: Classical Machine LearningLinear RegressionHard
Mastery:

Linear Regression: 推导线性回归的最小二乘解,并说明其几何意义。

📐 Mathematical Definition
∇w∥y−Xw∥2=0⇒X⊤Xw=X⊤y\nabla_w\|y-Xw\|^2=0\Rightarrow X^\top Xw=X^\top y
⚡ Executive Summary
Core Concept: 对残差平方和求导置零得正规方程;几何上是把 y 正交投影到 X 的列空间。

📌 Key Takeaways

  • •
    残差与列空间正交(Xᵀe=0)
  • •
    投影矩阵 H=X(XᵀX)⁻¹Xᵀ(帽子矩阵)

📐 Mathematical Derivations

推导:L(w)=(y−Xw)ᵀ(y−Xw)=yᵀy−2wᵀXᵀy+wᵀXᵀXw;梯度 ∇L=−2Xᵀy+2XᵀXw;置零得正规方程 XᵀXw=Xᵀy。几何解释:Xw 的所有可能取值构成 X 的<strong>列空间</strong> C(X)(一个 p 维子空间),最小化 ‖y−Xw‖² 就是在这个子空间中找离 y 最近的点——即 y 的<strong>正交投影</strong> ŷ=Hy,其中 H=X(XᵀX)⁻¹Xᵀ。正交性体现为残差 e=y−ŷ 与列空间垂直:Xᵀe=Xᵀ(y−Xw)=0。这也给出了勾股分解:‖y‖²=‖ŷ‖²+‖e‖²,即总平方和 = 回归平方和 + 残差平方和,这是 R²=1−SSE/SST 的几何基础。

🏭 Production Trade-offs

三个延伸要点:① <strong>帽子矩阵与杠杆值</strong>——H 的对角元 hᵢᵢ=∂ŷᵢ/∂yᵢ 衡量第 i 个样本的'自我影响',称为<strong>杠杆值</strong>,范围 [0,1],且 Σhᵢᵢ=p(p 为参数个数)。hᵢᵢ 接近 1 说明该点几乎决定了自身预测,是<strong>高杠杆点</strong>;若同时残差大则为<strong>强影响点</strong>(可用 Cook's distance 综合度量)。② <strong>自由度与 R² 校正</strong>——残差自由度为 n−p,解释了为什么调整 R² 要惩罚参数个数。③ <strong>推广</strong>——同样的投影几何适用于任何线性基(多项式、样条、核),核岭回归就是把投影搬到核诱导的特征空间(用核技巧避免显式映射)。
⚠️ Common Interview Pitfalls
  • ✕
    认为最小二乘需要迭代求解(线性最小二乘有闭式解)
  • ✕
    忽略杠杆值,把高杠杆点的影响误读为真实关系
🎯 Interviewer Follow-ups
  • ?
    帽子矩阵的对角线有什么含义?(杠杆值)
  • ?
    为什么高杠杆点影响大?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM2-004: Linear Regression: 岭回归为什么能缓解共线性?写出它的解。📋Back to BankNext →M2-006: Logistic Regression & GLM: 写出逻辑回归的模型形式与损失函数。