M2-016M2: Classical Machine LearningRegularization (L1 / L2)Hard
Mastery:

Regularization (L1 / L2): 数据增强作为正则化手段的原理是什么?举例说明。

📐 Mathematical Definition
aug: x→T(x),y 不变\text{aug}:\ x\to T(x),\quad y\ \text{不变}
⚡ Executive Summary
Core Concept: 通过构造保持标签不变的新样本,扩充有效数据分布,降低方差、提升不变性。

📌 Key Takeaways

  • •
    CV:翻转/裁剪/颜色抖动/Mixup/CutMix
  • •
    NLP:同义替换/回译/token dropout
  • •
    必须保证标签不变(否则引入噪声)

📐 Mathematical Derivations

原理可从三个角度理解:① <strong>扩大有效数据</strong>——数据增强把训练分布'填充'得更密,等效于增加样本量,从而降低方差(方差 ∝ 1/n);② <strong>编码先验不变性</strong>——翻转/旋转增强告诉模型'这些变换不改变语义',把人类先验注入模型,减少需要从数据中学的不变性;③ <strong>平滑决策边界</strong>——Mixup 等插值型增强使模型在样本间平滑过渡,等价于对损失函数做 Lipschitz 约束(抑制过拟合)。<strong>关键前提</strong>是标签在变换下<strong>不变</strong>:水平翻转对猫狗分类成立,但对'识别字母 b/d'或'区分左右手'不成立,此时增强会引入标签噪声反而有害。

🏭 Production Trade-offs

典型方法与权衡:① <strong>CV</strong>——翻转/裁剪/旋转(几何)、颜色抖动/高斯噪声(光度)、Cutout/Random Erasing(遮挡)、Mixup/CutMix(插值混合,同时平滑标签,改善校准);② <strong>NLP</strong>——同义替换、回译、token dropout、EDA;LLM 时代更常用<strong>数据合成</strong>(用强模型生成)替代传统增强;③ <strong>Mixup 的双重效果</strong>——它同时平滑了输入与标签,因此不仅提升泛化还显著改善<strong>校准</strong>(缓解过自信),但对 BN 有影响(混合样本的统计量偏移,可用 Manifold Mixup 或调整 BN);④ <strong>增强强度的调参</strong>——过强会破坏语义(如过度裁剪把目标裁掉),过弱无效果;常用 RandAugment/TrivialAugment 自动搜索强度。⑤ <strong>测试时增强(TTA)</strong>——推理时对同一输入做多种增强后取平均,是免费的精度提升(代价是推理成本倍增)。
⚠️ Common Interview Pitfalls
  • ✕
    使用会改变标签的增强(如对方向敏感任务做翻转)
  • ✕
    增强过强导致语义破坏(如裁剪掉目标主体)
🎯 Interviewer Follow-ups
  • ?
    Mixup 为什么能提升泛化与校准?
  • ?
    哪些增强会破坏标签语义?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM2-015: Regularization (L1 / L2): 解释早停(early stopping)为什么等价于某种正则化。📋Back to BankNext →M2-017: Bias-Variance Tradeoff & Model Selection: 如何用学习曲线诊断高偏差与高方差?