M3-047M3: Deep Learning FoundationsRegularization & Training TricksEasy
Mastery:

Regularization & Training Tricks: 列举深度学习中主要的正则化手段。

📐 Mathematical Definition
Lreg=L(θ)+λΩ(θ);ΩL2=12∥θ∥2\mathcal{L}_{\text{reg}}=\mathcal{L}(\theta)+\lambda\Omega(\theta);\qquad \Omega_{\text{L2}}=\tfrac12\|\theta\|^2
⚡ Executive Summary
Core Concept: 数据增强、权重衰减、dropout、早停、label smoothing、噪声注入、集成/EMA、Mixup/CutMix 等,按'加先验'分类。

📌 Key Takeaways

  • •
    参数正则(L1/L2/weight decay)
  • •
    数据正则(augmentation、Mixup、CutMix、噪声)
  • •
    结构正则(dropout、stochastic depth、参数共享)
  • •
    训练正则(早停、EMA/SWA、集成)

📐 Mathematical Derivations

数学机理:正则化的本质是<strong>注入先验以限制假设空间</strong>,从偏差-方差权衡角度即'用略增偏差换取方差下降'。分类如下:<strong>(1) 参数正则</strong>——L2 对应高斯先验(MAP 视角),把权重向 0 收缩;L1 对应拉普拉斯先验,产生稀疏解(特征选择)。<strong>(2) 数据正则</strong>——数据增强(翻转/裁剪/颜色抖动/旋转)注入'这些变换不改变语义'的等变先验;Mixup 用线性插值样本与标签,注入'样本间线性插值仍有效'的先验,等价于对 loss 的 Lipschitz 约束;CutMix 用区域粘贴,注入局部性先验。<strong>(3) 结构正则</strong>——dropout 随机置零神经元,等价于训练 2ⁿ 个子网络的集成(inference 时用期望近似),注入'特征不应过度依赖单个单元'的先验;stochastic depth 随机跳过残差块,是 dropout 的层级版本。<strong>(4) 训练正则</strong>——早停在验证 loss 上升时停止,抑制过拟合;EMA/SWA 平滑参数轨迹,偏向平坦解;模型集成平均多个模型的预测,降低方差。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>性价比排序</strong>——实践中数据增强通常收益最大(尤其 CV),因为它直接扩展了有效数据分布;权重衰减次之(几乎零成本);dropout 在大模型时代作用下降(见对应题)。② <strong>正则强度的调参</strong>——λ 过大导致欠拟合(训练 loss 都不降),过小无效;标准做法是在验证集上扫描 λ 的对数尺度。③ <strong>与大模型的关系</strong>——LLM 预训练几乎只用权重衰减(不用 dropout、不用数据增强,因数据本身海量);而<strong>微调/小数据</strong>场景则需全套正则(dropout、早停、LoRA 的隐式正则)。④ <strong>正则的组合</strong>——多种正则叠加常有效但收益递减,且相互影响(如 dropout + 强 weight decay 可能过度收缩);建议一次只调一个。⑤ <strong>隐式正则</strong>——SGD 的梯度噪声、小 batch、早停本身都是隐式正则,理解这一点可避免'重复正则化'。⑥ <strong>面试要点</strong>——回答应按<strong>类别</strong>组织(参数/数据/结构/训练),而非罗列名词;并主动说明'不同规模下各手段的权重不同'。
⚠️ Common Interview Pitfalls
  • ✕
    在大规模预训练上套用小数据正则(无效甚至有害)
  • ✕
    同时调节多种正则的强度(无法归因)
🎯 Interviewer Follow-ups
  • ?
    为什么数据增强是'最划算'的正则?
  • ?
    L1 与 L2 分别对应什么先验?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM3-046: Learning Rate Schedules: 解释 One-Cycle / 循环学习率策略。📋Back to BankNext →M3-048: Regularization & Training Tricks: 解释权重衰减为什么常与学习率解耦。