M2-098M2: Classical Machine LearningRegularization (L1 / L2)Hard
Mastery:

Regularization (L1 / L2): 解释谱范数正则化与 Lipschitz 约束的关系。

📐 Mathematical Definition
∥f∥Lip=∏l∥Wl∥2,∥f(x)−f(x′)∥≤∥f∥Lip∥x−x′∥\|f\|_{Lip}=\prod_l\|W_l\|_2,\qquad \|f(x)-f(x')\|\le\|f\|_{Lip}\|x-x'\|
⚡ Executive Summary
Core Concept: 谱范数 = 层的 Lipschitz 常数;约束谱范数即约束输出对输入的敏感度。

📌 Key Takeaways

  • •
    谱范数正则惩罚最大奇异值
  • •
    谱归一化(SN)直接除以谱范数

📐 Mathematical Derivations

数学关系:对多层网络 f(x)=W_Lσ(…σ(W_1x)…),若激活函数的 Lipschitz 常数为 1(ReLU、LeakyReLU、以及有界导数的激活都满足),则整个网络的 Lipschitz 常数满足 <strong>‖f‖_Lip ≤ Πₗ‖Wₗ‖₂</strong>(每层的谱范数之积)。因此<strong>约束每层的谱范数 ≤1 就保证整个网络是 1-Lipschitz</strong>。<strong>Lipschitz 约束的含义</strong>:‖f(x)−f(x')‖≤L‖x−x'‖,即输入的微小扰动(如对抗扰动)最多被放大 L 倍——这直接决定了<strong>对抗鲁棒性</strong>(若 L 小,则小扰动不会大幅改变输出)。<strong>两种实现</strong>:① <strong>谱正则化</strong>——在损失中加入 Σₗ‖Wₗ‖₂(谱范数)作为惩罚项,用幂迭代估计 σ_max,软约束;② <strong>谱归一化(Spectral Normalization)</strong>——直接把每层权重除以它的谱范数(W←W/σ_max(W)),硬约束为 1-Lipschitz,这是 SN-GAN 与对抗训练的标准做法(计算便宜:每步一次幂迭代)。

🏭 Production Trade-offs

实践要点:① <strong>为什么优于 L2</strong>——L2 正则惩罚 ‖W‖_F²(所有奇异值平方和),会同时收缩大奇异值与小奇异值;而 Lipschitz 只由<strong>最大</strong>奇异值决定,故谱范数正则<strong>更直接</strong>地控制敏感度(L2 可能把大奇异值收缩得不够而小奇异值收缩过度)。② <strong>GAN 中的应用</strong>——WGAN 要求 critic 是 1-Lipschitz,最初用 weight clipping(粗暴、导致参数集中在边界),后改 WGAN-GP(梯度惩罚)与 SN(谱归一化);SN 因其高效稳定成为主流(SN-GAN)。③ <strong>对抗鲁棒性</strong>——理论上,Lipschitz 常数小的模型对对抗扰动更鲁棒;实践中<strong>谱归一化 + 对抗训练</strong>是提升鲁棒性的标准组合。④ <strong>其他应用</strong>——<strong>流模型(Normalizing Flow)</strong> 需约束 Lipschitz 保证可逆性与稳定性;<strong>扩散模型的 Lipschitz 约束</strong>用于稳定性分析;<strong>度量学习</strong>中用 Lipschitz 约束保证嵌入的平滑性。⑤ <strong>计算成本</strong>——幂迭代近似 σ_max 需每步额外几次矩阵-向量乘(成本约为前向的 5–10%),可接受;精确 SVD 太贵不可用。⑥ <strong>局限</strong>——谱范数约束的是<strong>最坏情况</strong>的敏感度(全局上界),可能过于保守(牺牲正常样本的精度);实践中常用<strong>近似约束</strong>(如软惩罚)平衡。
⚠️ Common Interview Pitfalls
  • ✕
    用 L2 正则代替 Lipschitz 约束(两者不等价)
  • ✕
    用精确 SVD 计算谱范数(应使用幂迭代)
🎯 Interviewer Follow-ups
  • ?
    为什么 Lipschitz 约束提升鲁棒性?
  • ?
    谱正则与 L2 正则的差异?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM2-097: Regularization (L1 / L2): 解释权重衰减在 Adam 中为什么要解耦(AdamW)。📋Back to BankNext →M2-099: Regularization (L1 / L2): 解释随机深度(Stochastic Depth / DropPath)与它与 Dropout 的差异。