TalentMe
How To
🗺️
AI Industry Map
NEW
Knowledge ▾
Intro & Usage
Machine Learning Repo
Data Science Repo
Resources ▾
Intro & Usage
AI Tech Vault (Tech Wiki)
Industry News
Tech Blogs
Research Papers
Open Source Projects
Tools Hub ▾
🛠️ Tools & Skills Overview
🌐 Interactive Web Tools
🗺️ AI Industry & Career Map
🧭 AI Career Transition Navigator & Roadmap
📚 AI Multi-Module Practice Hub
🎯 AI Skill Assessment
🧠 AI Skills Library
AI Skills & Prompts Overview
Local Agent Guide
Cloud Skills Templates
⚡ MCP Tools Suite
TalentMe MCP Guide
CLI Tools & Commands
Services ▾
🚀 Services & Plans Suite
🧭 1v1 Coaching & Services
💎 Plans & Pricing
💬 Contact & Consultation
Contact Us
💬 Discord
🌐
中
☀️
🔑
Login / Register
☰
技术知识库
›
复习路线图
›
数理基础 思维导图
›
L1/L2 正则化几何
← 返回 数理基础 思维导图
中文
·
English
📐 数理基础
ID:
regularization-geometry
L1/L2 正则化几何
Regularization Geometry
🎯
核心定义
正则化等价于在损失上加惩罚项或用约束域限制解:
min
w
L
(
w
)
\min_w L(w)
min
w
L
(
w
)
s.t.
∥
w
∥
p
≤
t
\Vert w\Vert_p \le t
∥
w
∥
p
≤
t
。L2(岭回归): 惩罚
λ
2
∥
w
∥
2
2
\frac{\lambda}{2}\Vert w\Vert_2^2
2
λ
∥
w
∥
2
2
,约束域是球;损失等高线(由数据决定的椭圆)与球面的切点处所有坐标被均匀缩小但一般不为 0。闭式解
w
∗
=
(
X
T
X
+
λ
I
)
−
1
X
T
y
w^* = (X^TX + \lambda I)^{-1}X^Ty
w
∗
=
(
X
T
X
+
λ
I
)
−
1
X
T
y
,经 SVD
X
=
U
Σ
V
T
X = U\Sigma V^T
X
=
U
Σ
V
T
可写为
w
∗
=
V
(
Σ
T
Σ
+
λ
I
)
−
1
Σ
T
U
T
y
w^* = V(\Sigma^T\Sigma + \lambda I)^{-1}\Sigma^TU^Ty
w
∗
=
V
(
Σ
T
Σ
+
λ
I
)
−
1
Σ
T
U
T
y
,即每个特征方向乘收缩因子
σ
i
2
σ
i
2
+
λ
\frac{\sigma_i^2}{\sigma_i^2 + \lambda}
σ
i
2
+
λ
σ
i
2
——小奇异值方向被压缩最多,同时保证
X
T
X
+
λ
I
X^TX + \lambda I
X
T
X
+
λ
I
满秩可逆。L1(Lasso): 约束域
∥
w
∥
1
≤
t
\Vert w\Vert_1 \le t
∥
w
∥
1
≤
t
是菱形(高维为超立方体),顶点恰好落在坐标轴上;损失椭圆与菱形相切时,最优点往往位于顶点或棱上 → 部分坐标恰为 0 → 稀疏解。
💡
使用场景
高维特征选择(L1)、病态/共线
X
T
X
X^TX
X
T
X
求逆不稳定(L2)、面试“为什么 L1 产生稀疏解”的几何与贝叶斯双重解释。
⚡
解决的核心痛点
贝叶斯视角下,正则化 = 先验的 MAP。L2 等价于高斯先验
w
∼
N
(
0
,
τ
2
I
)
w \sim \mathcal{N}(0, \tau^2 I)
w
∼
N
(
0
,
τ
2
I
)
(取
λ
=
σ
2
/
τ
2
\lambda = \sigma^2/\tau^2
λ
=
σ
2
/
τ
2
):
w
^
M
A
P
=
arg
max
w
−
1
2
σ
2
∥
y
−
X
w
∥
2
−
1
2
τ
2
∥
w
∥
2
\hat w_{MAP} = \arg\max_w -\frac{1}{2\sigma^2}\Vert y - Xw\Vert^2 - \frac{1}{2\tau^2}\Vert w\Vert^2
w
^
M
A
P
=
ar
g
max
w
−
2
σ
2
1
∥
y
−
X
w
∥
2
−
2
τ
2
1
∥
w
∥
2
,高斯先验尾部平滑、众数无尖峰 → 权重全缩小但非零;L1 等价于拉普拉斯先验
p
(
w
)
∝
e
−
λ
∣
w
∣
p(w) \propto e^{-\lambda|w|}
p
(
w
)
∝
e
−
λ
∣
w
∣
,其密度在 0 处有尖峰(概率质量集中于 0 附近)→ 后验众数偏向把权重置 0。正则化降低方差(缓解过拟合)、使解唯一,代价是引入偏差。
🎯
5 个高频面试考点 (Exam Points)
1
画出 L1(菱形)与 L2(球)的约束域,解释为什么损失椭圆与菱形相切于顶点时得到稀疏解,而球切点一般不在坐标轴上。
2
推导岭回归闭式解
w
=
(
X
T
X
+
λ
I
)
−
1
X
T
y
w = (X^TX+\lambda I)^{-1}X^Ty
w
=
(
X
T
X
+
λ
I
)
−
1
X
T
y
,并用 SVD 说明各方向收缩因子
σ
i
2
/
(
σ
i
2
+
λ
)
\sigma_i^2/(\sigma_i^2+\lambda)
σ
i
2
/
(
σ
i
2
+
λ
)
的行为。
3
贝叶斯视角: 写出高斯/拉普拉斯先验下的对数后验,证明 L2 = 高斯先验 MAP、L1 = 拉普拉斯先验 MAP。
4
为什么 L1 能恰好落在不可导的拐角处?写出 lasso 的次梯度条件
0
∈
X
T
(
X
w
−
y
)
+
λ
∂
∥
w
∥
1
0 \in X^T(Xw-y) + \lambda\partial\Vert w\Vert_1
0
∈
X
T
(
X
w
−
y
)
+
λ
∂
∥
w
∥
1
并解释。
5
正则化强度
λ
\lambda
λ
如何联动偏差-方差?为什么说正则化是“以偏差换方差”的手段?
📖 关联深度指南:
📄 optimization-and-matrix-calculus →
更新于 2026-08-12
🎯
检验攻克程度:针对「L1/L2 正则化几何」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题 ➔
← 上一个知识点
牛顿法 vs 梯度下降
下一个知识点 →
偏差方差分解
🔗 更多 数理基础 知识点卡片
Adam/AdamW 偏差修正推导
贝叶斯推断
Bootstrap
因果推断与 Rubin 框架