返回 深度学习 思维导图
中文·English
🧠 深度学习ID: data-augmentation

数据增强

Data Augmentation
🎯核心定义
对训练样本施加保持标签的变换以扩充数据。几何类: 水平翻转、随机裁剪、旋转、缩放、色彩抖动 (利用图像的平移/翻转不变性先验); 混合类: Mixup 在样本间线性插值 x=λxi+(1λ)xjx' = \lambda x_i + (1-\lambda) x_j, y=λyi+(1λ)yjy' = \lambda y_i + (1-\lambda) y_j, 其中 λBeta(α,α)\lambda \sim \text{Beta}(\alpha, \alpha), CutMix 则混合图像区域而非像素。增强等价于正则化: 隐式约束模型在变换空间与样本邻域上平滑, 抑制过拟合, 效果上近似于在损失中引入额外先验/平滑性。
💡使用场景
数据量不足的 CV 任务 (分类/检测/分割)、自监督学习 (SimCLR 等用随机增强构造正样本对)、半监督一致性训练; 面试问增强为什么有效、与正则化的关系。
解决的核心痛点
标注数据昂贵, 增强以近乎零成本扩容: 翻转/裁剪注入不变性先验, Mixup/CutMix 通过让输出在样本间线性过渡来平滑决策边界、提升泛化 (隐式平滑正则); 与 dropout/weight decay 同属正则化家族、可组合使用。副作用: 过度增强会破坏语义 (标签失效) 或增加训练成本, 需按任务选择变换。
🎯5 个高频面试考点 (Exam Points)
1
写出 Mixup 的公式? 为什么 Mixup 等价于正则化?
2
随机裁剪/翻转为什么有效? 利用了图像的什么先验?
3
数据增强与 dropout/weight decay 在正则化上的关系?
4
增强在自监督学习中如何构造正负样本 (SimCLR)?
5
过度增强有什么副作用? 如何避免?
📖 关联深度指南:📄 debugging-and-dl-comp
更新于 2026-08-12
🎯
检验攻克程度:针对「数据增强」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点梯度检查下一个知识点迁移学习与微调

🔗 更多 深度学习 知识点卡片

激活函数演进Adam/AdamWAutograd 动态图BatchNorm 批归一化