M3-047M3: Deep Learning FoundationsRegularization & Training TricksEasy
Mastery:
Regularization & Training Tricks: 列举深度学习中主要的正则化手段。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 数据增强、权重衰减、dropout、早停、label smoothing、噪声注入、集成/EMA、Mixup/CutMix 等,按'加先验'分类。
📌 Key Takeaways
- •参数正则(L1/L2/weight decay)
- •数据正则(augmentation、Mixup、CutMix、噪声)
- •结构正则(dropout、stochastic depth、参数共享)
- •训练正则(早停、EMA/SWA、集成)
📐 Mathematical Derivations
数学机理:正则化的本质是<strong>注入先验以限制假设空间</strong>,从偏差-方差权衡角度即'用略增偏差换取方差下降'。分类如下:<strong>(1) 参数正则</strong>——L2 对应高斯先验(MAP 视角),把权重向 0 收缩;L1 对应拉普拉斯先验,产生稀疏解(特征选择)。<strong>(2) 数据正则</strong>——数据增强(翻转/裁剪/颜色抖动/旋转)注入'这些变换不改变语义'的等变先验;Mixup 用线性插值样本与标签,注入'样本间线性插值仍有效'的先验,等价于对 loss 的 Lipschitz 约束;CutMix 用区域粘贴,注入局部性先验。<strong>(3) 结构正则</strong>——dropout 随机置零神经元,等价于训练 2ⁿ 个子网络的集成(inference 时用期望近似),注入'特征不应过度依赖单个单元'的先验;stochastic depth 随机跳过残差块,是 dropout 的层级版本。<strong>(4) 训练正则</strong>——早停在验证 loss 上升时停止,抑制过拟合;EMA/SWA 平滑参数轨迹,偏向平坦解;模型集成平均多个模型的预测,降低方差。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>性价比排序</strong>——实践中数据增强通常收益最大(尤其 CV),因为它直接扩展了有效数据分布;权重衰减次之(几乎零成本);dropout 在大模型时代作用下降(见对应题)。② <strong>正则强度的调参</strong>——λ 过大导致欠拟合(训练 loss 都不降),过小无效;标准做法是在验证集上扫描 λ 的对数尺度。③ <strong>与大模型的关系</strong>——LLM 预训练几乎只用权重衰减(不用 dropout、不用数据增强,因数据本身海量);而<strong>微调/小数据</strong>场景则需全套正则(dropout、早停、LoRA 的隐式正则)。④ <strong>正则的组合</strong>——多种正则叠加常有效但收益递减,且相互影响(如 dropout + 强 weight decay 可能过度收缩);建议一次只调一个。⑤ <strong>隐式正则</strong>——SGD 的梯度噪声、小 batch、早停本身都是隐式正则,理解这一点可避免'重复正则化'。⑥ <strong>面试要点</strong>——回答应按<strong>类别</strong>组织(参数/数据/结构/训练),而非罗列名词;并主动说明'不同规模下各手段的权重不同'。
⚠️ Common Interview Pitfalls
- ✕在大规模预训练上套用小数据正则(无效甚至有害)
- ✕同时调节多种正则的强度(无法归因)
🎯 Interviewer Follow-ups
- ?为什么数据增强是'最划算'的正则?
- ?L1 与 L2 分别对应什么先验?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.