返回 数理基础 思维导图
中文·English
📐 数理基础ID: regularization-geometry

L1/L2 正则化几何

Regularization Geometry
🎯核心定义
正则化等价于在损失上加惩罚项或用约束域限制解: minwL(w)\min_w L(w) s.t. wpt\Vert w\Vert_p \le t。L2(岭回归): 惩罚 λ2w22\frac{\lambda}{2}\Vert w\Vert_2^2,约束域是球;损失等高线(由数据决定的椭圆)与球面的切点处所有坐标被均匀缩小但一般不为 0。闭式解 w=(XTX+λI)1XTyw^* = (X^TX + \lambda I)^{-1}X^Ty,经 SVD X=UΣVTX = U\Sigma V^T 可写为 w=V(ΣTΣ+λI)1ΣTUTyw^* = V(\Sigma^T\Sigma + \lambda I)^{-1}\Sigma^TU^Ty,即每个特征方向乘收缩因子 σi2σi2+λ\frac{\sigma_i^2}{\sigma_i^2 + \lambda}——小奇异值方向被压缩最多,同时保证 XTX+λIX^TX + \lambda I 满秩可逆。L1(Lasso): 约束域 w1t\Vert w\Vert_1 \le t 是菱形(高维为超立方体),顶点恰好落在坐标轴上;损失椭圆与菱形相切时,最优点往往位于顶点或棱上 → 部分坐标恰为 0 → 稀疏解。
💡使用场景
高维特征选择(L1)、病态/共线 XTXX^TX 求逆不稳定(L2)、面试“为什么 L1 产生稀疏解”的几何与贝叶斯双重解释。
解决的核心痛点
贝叶斯视角下,正则化 = 先验的 MAP。L2 等价于高斯先验 wN(0,τ2I)w \sim \mathcal{N}(0, \tau^2 I)(取 λ=σ2/τ2\lambda = \sigma^2/\tau^2): w^MAP=argmaxw12σ2yXw212τ2w2\hat w_{MAP} = \arg\max_w -\frac{1}{2\sigma^2}\Vert y - Xw\Vert^2 - \frac{1}{2\tau^2}\Vert w\Vert^2,高斯先验尾部平滑、众数无尖峰 → 权重全缩小但非零;L1 等价于拉普拉斯先验 p(w)eλwp(w) \propto e^{-\lambda|w|},其密度在 0 处有尖峰(概率质量集中于 0 附近)→ 后验众数偏向把权重置 0。正则化降低方差(缓解过拟合)、使解唯一,代价是引入偏差。
🎯5 个高频面试考点 (Exam Points)
1
画出 L1(菱形)与 L2(球)的约束域,解释为什么损失椭圆与菱形相切于顶点时得到稀疏解,而球切点一般不在坐标轴上。
2
推导岭回归闭式解 w=(XTX+λI)1XTyw = (X^TX+\lambda I)^{-1}X^Ty,并用 SVD 说明各方向收缩因子 σi2/(σi2+λ)\sigma_i^2/(\sigma_i^2+\lambda) 的行为。
3
贝叶斯视角: 写出高斯/拉普拉斯先验下的对数后验,证明 L2 = 高斯先验 MAP、L1 = 拉普拉斯先验 MAP。
4
为什么 L1 能恰好落在不可导的拐角处?写出 lasso 的次梯度条件 0XT(Xwy)+λw10 \in X^T(Xw-y) + \lambda\partial\Vert w\Vert_1 并解释。
5
正则化强度 λ\lambda 如何联动偏差-方差?为什么说正则化是“以偏差换方差”的手段?
更新于 2026-08-12
🎯
检验攻克程度:针对「L1/L2 正则化几何」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点牛顿法 vs 梯度下降下一个知识点偏差方差分解

🔗 更多 数理基础 知识点卡片

Adam/AdamW 偏差修正推导贝叶斯推断Bootstrap因果推断与 Rubin 框架