返回 经典机器学习 思维导图
中文·English
📊 经典机器学习ID: linear-regression

线性回归 OLS

Linear Regression OLS
🎯核心定义
线性回归 (OLS, 普通最小二乘) 假设 y=Xw+εy = Xw + \varepsilon, 目标是让预测超平面离样本最近——最小化残差平方和 L(w)=yXw22L(w) = \Vert y - Xw\Vert_2^2。展开并对 ww 求导: Lw=2XT(Xwy)\frac{\partial L}{\partial w} = 2X^T(Xw - y), 令梯度为 0 得正规方程 XTXw=XTyX^TXw = X^Ty, 当 XX 满列秩 (XTXX^TX 可逆) 时闭式解 w=(XTX)1XTyw = (X^TX)^{-1}X^Ty, 复杂度约 O(nd2+d3)O(nd^2 + d^3) (构造 XTXX^TX + 求逆), 高维下改用梯度下降 (每轮 O(nd)O(nd))。5 大假设 (Gauss-Markov): ① 线性性 (真实关系对参数线性) ② 零条件均值 E[εX]=0E[\varepsilon \mid X] = 0 (外生性) ③ 同方差 Var(ε)=σ2IVar(\varepsilon) = \sigma^2 I ④ 误差相互独立 ⑤ 无完全多重共线性 (rank(X)=drank(X) = d); 再做小样本推断还需误差正态分布。
💡使用场景
回归任务的基线模型; 面试高频: 白板推导正规方程、讨论 XTXX^TX 不可逆怎么办 (伪逆 / 岭回归加 λI\lambda I / 剔除共线特征)、OLS 与梯度下降复杂度对比。
解决的核心痛点
L(w)L(w) 是凸二次函数 (Hessian =2XTX0= 2X^TX \succeq 0), 正规方程一步求出全局最优, 无需调学习率; 相比 kkNN 等非参数方法, OLS 给出可解释系数 (wjw_j 即控制其它变量后 xjx_j 的边际效应)。但 5 大假设被违反时 (共线 → XTXX^TX 病态、异方差 → 标准误失真), 需转向岭回归或加权最小二乘。
🎯5 个高频面试考点 (Exam Points)
1
白板推导正规方程: 展开 L(w)=yXw2L(w) = \Vert y - Xw\Vert^2 求梯度、令为 0, 写出 w=(XTX)1XTyw = (X^TX)^{-1}X^Ty; XTXX^TX 可逆需要什么条件?
2
线性回归 5 大假设分别是什么? 每一条被违反时估计量的无偏性/有效性/一致性会怎样?
3
XTXX^TX 奇异或病态怎么办? 比较伪逆、岭回归 w=(XTX+λI)1XTyw = (X^TX + \lambda I)^{-1}X^Ty 与剔除共线特征三种方案。
4
陈述 Gauss-Markov 定理: 5 大假设下 OLS 是 BLUE (最优线性无偏估计), 为什么正态性假设不在其中?
5
推导正规方程的时间/空间复杂度 (构造 XTXX^TXO(nd2)O(nd^2), 求逆为 O(d3)O(d^3)), 说明高维稀疏场景为什么选梯度下降。
更新于 2026-08-12
🎯
检验攻克程度:针对「线性回归 OLS」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
下一个知识点VIF 多重共线性

🔗 更多 经典机器学习 知识点卡片

AdaBoost 算法手推Bagging 与随机森林HMM 参数学习 Baum-WelchGBDT 负梯度拟合