M2-096M2: Classical Machine LearningRegularization (L1 / L2)Medium
Mastery:

Regularization (L1 / L2): 解释 L1 与 L2 正则化的贝叶斯解释。

📐 Mathematical Definition
p(w)=N(0,τ2I)⇒L2;p(w)∝e−∣w∣/b⇒L1p(w)=\mathcal N(0,\tau^2I)\Rightarrow \text{L2};\qquad p(w)\propto e^{-|w|/b}\Rightarrow \text{L1}
⚡ Executive Summary
Core Concept: L2 = 高斯先验下的 MAP;L1 = Laplace 先验下的 MAP;正则强度 = 先验方差的倒数。

📌 Key Takeaways

  • •
    λ = 1/(2τ²)(高斯)或 λ = 1/b(Laplace)
  • •
    Laplace 在 0 处的尖峰 ⇒ 稀疏

📐 Mathematical Derivations

推导:MAP 估计最大化 log p(D|w)+log p(w)。① <strong>高斯先验</strong> p(w)=N(0,τ²I) → log p(w)=−‖w‖²/(2τ²)+const → 目标变为 log 似然 − λ‖w‖²,其中 λ=1/(2τ²),即 <strong>L2 正则(岭回归/权重衰减)</strong>;② <strong>Laplace 先验</strong> p(w)∝exp(−|w|/b) → log p(w)=−‖w‖₁/b → 目标变为 log 似然 − λ‖w‖₁,即 <strong>L1 正则(LASSO)</strong>。<strong>为什么 Laplace 导致稀疏</strong>:Laplace 分布在 w=0 处有<strong>尖峰(不可导的角点)</strong>,其对数先验在该点的'梯度'有跳变;当似然项对某系数的'推力'不够强时,后验众数恰好落在角点上(w=0)。相比之下高斯先验在 0 处平滑(导数为 0),后验众数只会被'收缩'但不会恰好为零。这给出了 L1 稀疏性的<strong>概率解释</strong>(与几何解释——菱形可行域的顶点——相互印证)。

🏭 Production Trade-offs

这一视角的实践价值:① <strong>正则强度 = 先验信念强度</strong>——λ 大对应先验方差小(强信念'系数应接近 0'),λ 小对应弱先验趋近 MLE;这解释了为什么数据量增加时最优 λ 应减小(先验被数据稀释)。② <strong>选择先验的依据</strong>——若认为'多数特征确实无关'(稀疏真值),用 Laplace(L1);若认为'所有特征都有小贡献',用高斯(L2);若不确定,用 ElasticNet(混合先验)或层次先验(Horseshoe 先验,自适应稀疏)。③ <strong>完整贝叶斯 vs MAP</strong>——MAP 只取后验众数(丢弃不确定性);完整贝叶斯需对后验积分(如贝叶斯线性回归的后验预测分布),能得到预测的不确定性估计,但计算更贵。④ <strong>对超参的先验</strong>——λ 本身也可加先验(层次贝叶斯),用经验贝叶斯或 MCMC 自动确定,避免交叉验证的成本。⑤ <strong>与深度学习的关系</strong>——weight decay 就是高斯先验(这解释了为什么它对所有权重同等收缩),而<strong>稀疏先验</strong>(L1、Horseshoe)在需要剪枝的场景更有用;此外 <strong>LoRA 的零初始化</strong>可理解为'强先验:增量应为 0'。
⚠️ Common Interview Pitfalls
  • ✕
    认为正则化只是'防止过拟合的技巧'(它有明确的先验解释)
  • ✕
    在高斯先验下期待稀疏解
🎯 Interviewer Follow-ups
  • ?
    为什么 Laplace 先验导致稀疏?
  • ?
    这与'正则化就是加先验'如何统一?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM2-095: Logistic Regression & GLM: 解释逻辑回归与最大熵模型的关系。📋Back to BankNext →M2-097: Regularization (L1 / L2): 解释权重衰减在 Adam 中为什么要解耦(AdamW)。