TalentMe
How To
🗺️
AI Industry Map
NEW
Knowledge ▾
Intro & Usage
Machine Learning Repo
Data Science Repo
Resources ▾
Intro & Usage
AI Tech Vault (Tech Wiki)
Industry News
Tech Blogs
Research Papers
Open Source Projects
Tools Hub ▾
🛠️ Tools & Skills Overview
🌐 Interactive Web Tools
🗺️ AI Industry & Career Map
🧭 AI Career Transition Navigator & Roadmap
📚 AI Multi-Module Practice Hub
🎯 AI Skill Assessment
🧠 AI Skills Library
AI Skills & Prompts Overview
Local Agent Guide
Cloud Skills Templates
⚡ MCP Tools Suite
TalentMe MCP Guide
CLI Tools & Commands
Services ▾
🚀 Services & Plans Suite
🧭 1v1 Coaching & Services
💎 Plans & Pricing
💬 Contact & Consultation
Contact Us
💬 Discord
🌐
中
☀️
🔑
Login / Register
☰
技术知识库
›
复习路线图
›
深度学习 思维导图
›
数据增强
← 返回 深度学习 思维导图
中文
·
English
🧠 深度学习
ID:
data-augmentation
数据增强
Data Augmentation
🎯
核心定义
对训练样本施加保持标签的变换以扩充数据。几何类: 水平翻转、随机裁剪、旋转、缩放、色彩抖动 (利用图像的平移/翻转不变性先验); 混合类: Mixup 在样本间线性插值
x
′
=
λ
x
i
+
(
1
−
λ
)
x
j
x' = \lambda x_i + (1-\lambda) x_j
x
′
=
λ
x
i
+
(
1
−
λ
)
x
j
,
y
′
=
λ
y
i
+
(
1
−
λ
)
y
j
y' = \lambda y_i + (1-\lambda) y_j
y
′
=
λ
y
i
+
(
1
−
λ
)
y
j
, 其中
λ
∼
Beta
(
α
,
α
)
\lambda \sim \text{Beta}(\alpha, \alpha)
λ
∼
Beta
(
α
,
α
)
, CutMix 则混合图像区域而非像素。增强等价于正则化: 隐式约束模型在变换空间与样本邻域上平滑, 抑制过拟合, 效果上近似于在损失中引入额外先验/平滑性。
💡
使用场景
数据量不足的 CV 任务 (分类/检测/分割)、自监督学习 (SimCLR 等用随机增强构造正样本对)、半监督一致性训练; 面试问增强为什么有效、与正则化的关系。
⚡
解决的核心痛点
标注数据昂贵, 增强以近乎零成本扩容: 翻转/裁剪注入不变性先验, Mixup/CutMix 通过让输出在样本间线性过渡来平滑决策边界、提升泛化 (隐式平滑正则); 与 dropout/weight decay 同属正则化家族、可组合使用。副作用: 过度增强会破坏语义 (标签失效) 或增加训练成本, 需按任务选择变换。
🎯
5 个高频面试考点 (Exam Points)
1
写出 Mixup 的公式? 为什么 Mixup 等价于正则化?
2
随机裁剪/翻转为什么有效? 利用了图像的什么先验?
3
数据增强与 dropout/weight decay 在正则化上的关系?
4
增强在自监督学习中如何构造正负样本 (SimCLR)?
5
过度增强有什么副作用? 如何避免?
📖 关联深度指南:
📄 debugging-and-dl-comp →
更新于 2026-08-12
🎯
检验攻克程度:针对「数据增强」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题 ➔
← 上一个知识点
梯度检查
下一个知识点 →
迁移学习与微调
🔗 更多 深度学习 知识点卡片
激活函数演进
Adam/AdamW
Autograd 动态图
BatchNorm 批归一化