M2-011M2: Classical Machine LearningRegularization (L1 / L2)Easy
Mastery:
Regularization (L1 / L2): 比较 L1、L2 与 ElasticNet 正则化的几何与效果差异。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: L1 稀疏(特征选择),L2 收缩(抗共线),ElasticNet 兼顾两者。
📌 Key Takeaways
- •L1 在 0 处不可导 → 坐标下降/近端法
- •L2 有闭式解且可微
- •EN 在强相关特征组上更稳定
📐 Mathematical Derivations
几何视角最直观:约束形式 min‖y−Xw‖² s.t. ‖w‖₁≤t 的可行域是<strong>菱形</strong>(顶点在坐标轴上),L2 约束的可行域是<strong>圆</strong>(无顶点)。损失等高线(椭圆)与可行域首次相切处即最优解;菱形的尖角使切点极可能落在坐标轴上 → 某些 wⱼ=0(稀疏)。解析视角:L1 的最优性条件含次梯度 ∂|wⱼ|=[−1,1](当 wⱼ=0),这给出<strong>软阈值</strong> wⱼ=sign(zⱼ)max(|zⱼ|−λ,0),即 |zⱼ|≤λ 的系数被精确置零;而 L2 的导数 2λwⱼ 在 0 处为 0,无法把系数推到零。
🏭 Production Trade-offs
实践选择依据:① <strong>L1(LASSO)</strong>——需要特征选择、高维稀疏(文本、基因)、要求可解释性;缺点是相关特征组中<strong>只随机保留一个</strong>(选择不稳定)、解路径不连续、p>n 时最多选出 n 个非零系数。② <strong>L2(Ridge)</strong>——特征都相关且有贡献、共线性严重、p>n 场景;缺点是<strong>不产生稀疏解</strong>,模型包含全部特征。③ <strong>ElasticNet</strong>——两者结合,既稀疏又在相关特征组上稳定('分组效应':相关特征倾向于同进同出);代价是需调两个超参(λ₁、λ₂),可用 CV 在二维网格搜索。④ <strong>算法差异</strong>——L1 不可微,用坐标下降(最常用,因每步有解析解)、近端梯度(ISTA/FISTA)、或 ADMM;L2 有闭式解或可直接用梯度法。⑤ <strong>实践中</strong>:若只关心预测精度,L2 通常足够;若需特征选择,L1 或 ElasticNet;若特征间相关性强且需稀疏,优先 ElasticNet。
⚠️ Common Interview Pitfalls
- ✕认为 L1 在相关特征上稳定(实际随机选一个)
- ✕以为 L2 也能产生精确零(只收缩不置零)
🎯 Interviewer Follow-ups
- ?高维稀疏场景选哪个?
- ?为什么 L1 能产生精确 0?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.