M1-029M1: Mathematics & Statistics FundamentalsConvex Optimization & KKTMedium
Mastery:
Convex Optimization & KKT: 解释 L1 为什么产生稀疏解,而 L2 不会。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: L1 的约束区域是菱形,其顶点在坐标轴上;最优解易落在顶点 → 部分系数恰为 0。L2 是圆,无顶点。
📌 Key Takeaways
- •L1 在 0 处不可导 → 次梯度/坐标下降/近端算法
- •L2 有闭式解(岭回归)
- •ElasticNet 兼顾稀疏与稳定性
📐 Mathematical Derivations
两种理解方式:<strong>几何视角</strong>——约束形式 min‖y−Xw‖² s.t. ‖w‖₁≤t 的可行域是<strong>菱形</strong>(二维时四个顶点在坐标轴上),而 L2 约束的可行域是<strong>圆</strong>。损失函数的等高线(椭圆)与可行域首次相切处即最优解;由于菱形有尖角且尖角恰在坐标轴上,切点极可能落在尖角上,此时某些 wⱼ=0。<strong>解析视角</strong>——对 L1 项求次梯度,最优性条件为 0∈∇(loss)+λ∂‖w‖₁,其中 ∂|wⱼ|=[−1,1](当 wⱼ=0)或 {sign(wⱼ)}(当 wⱼ≠0)。这给出<strong>软阈值</strong>形式:wⱼ=sign(zⱼ)·max(|zⱼ|−λ,0),即只要原始梯度对应的解 |zⱼ|≤λ,该系数就被精确置零。L2 的导数 2λwⱼ 在 wⱼ=0 处为 0,无法把系数'推'到零。
🏭 Production Trade-offs
工程权衡:① <strong>L1 的稀疏性带来特征选择与可解释性</strong>,适合高维稀疏场景(文本、基因);但代价是<strong>在强相关特征组中只随机保留一个</strong>,选择不稳定(换个样本可能选中另一个),且解路径不连续。② <strong>L2 收缩但不置零</strong>,对共线特征组做'均摊收缩',更稳定,且有闭式解(岭回归)计算更快。③ <strong>ElasticNet</strong> 结合两者:λ₁‖w‖₁+λ₂‖w‖²,既稀疏又对相关特征组稳定('分组效应')。④ <strong>算法上</strong> L1 不可微,需用近端梯度法(ISTA/FISTA)、坐标下降或 ADMM;L2 可直接求导用梯度法或闭式解。实践中,若只关心预测精度而不关心稀疏性,L2 通常够用;若需特征选择,L1 或 ElasticNet 更合适。
⚠️ Common Interview Pitfalls
- ✕认为 L1 在相关特征上稳定(实际是随机选一个)
- ✕以为 L2 也能产生精确零(它只收缩)
🎯 Interviewer Follow-ups
- ?为什么 L1 有闭式解吗?
- ?坐标下降为什么适合 L1?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.