M2-011M2: Classical Machine LearningRegularization (L1 / L2)Easy
Mastery:

Regularization (L1 / L2): 比较 L1、L2 与 ElasticNet 正则化的几何与效果差异。

📐 Mathematical Definition
L1:λ∥w∥1,L2:λ∥w∥22,EN:λ1∥w∥1+λ2∥w∥22L1:\lambda\|w\|_1,\quad L2:\lambda\|w\|_2^2,\quad EN:\lambda_1\|w\|_1+\lambda_2\|w\|_2^2
⚡ Executive Summary
Core Concept: L1 稀疏(特征选择),L2 收缩(抗共线),ElasticNet 兼顾两者。

📌 Key Takeaways

  • •
    L1 在 0 处不可导 → 坐标下降/近端法
  • •
    L2 有闭式解且可微
  • •
    EN 在强相关特征组上更稳定

📐 Mathematical Derivations

几何视角最直观:约束形式 min‖y−Xw‖² s.t. ‖w‖₁≤t 的可行域是<strong>菱形</strong>(顶点在坐标轴上),L2 约束的可行域是<strong>圆</strong>(无顶点)。损失等高线(椭圆)与可行域首次相切处即最优解;菱形的尖角使切点极可能落在坐标轴上 → 某些 wⱼ=0(稀疏)。解析视角:L1 的最优性条件含次梯度 ∂|wⱼ|=[−1,1](当 wⱼ=0),这给出<strong>软阈值</strong> wⱼ=sign(zⱼ)max(|zⱼ|−λ,0),即 |zⱼ|≤λ 的系数被精确置零;而 L2 的导数 2λwⱼ 在 0 处为 0,无法把系数推到零。

🏭 Production Trade-offs

实践选择依据:① <strong>L1(LASSO)</strong>——需要特征选择、高维稀疏(文本、基因)、要求可解释性;缺点是相关特征组中<strong>只随机保留一个</strong>(选择不稳定)、解路径不连续、p>n 时最多选出 n 个非零系数。② <strong>L2(Ridge)</strong>——特征都相关且有贡献、共线性严重、p>n 场景;缺点是<strong>不产生稀疏解</strong>,模型包含全部特征。③ <strong>ElasticNet</strong>——两者结合,既稀疏又在相关特征组上稳定('分组效应':相关特征倾向于同进同出);代价是需调两个超参(λ₁、λ₂),可用 CV 在二维网格搜索。④ <strong>算法差异</strong>——L1 不可微,用坐标下降(最常用,因每步有解析解)、近端梯度(ISTA/FISTA)、或 ADMM;L2 有闭式解或可直接用梯度法。⑤ <strong>实践中</strong>:若只关心预测精度,L2 通常足够;若需特征选择,L1 或 ElasticNet;若特征间相关性强且需稀疏,优先 ElasticNet。
⚠️ Common Interview Pitfalls
  • ✕
    认为 L1 在相关特征上稳定(实际随机选一个)
  • ✕
    以为 L2 也能产生精确零(只收缩不置零)
🎯 Interviewer Follow-ups
  • ?
    高维稀疏场景选哪个?
  • ?
    为什么 L1 能产生精确 0?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM2-010: Logistic Regression & GLM: 如何处理逻辑回归中的完全分离(separation)问题?📋Back to BankNext →M2-012: Regularization (L1 / L2): 正则化系数 λ 如何选择?过大过小分别会怎样。