返回 深度学习 思维导图
中文·English
🧠 深度学习ID: label-smoothing

Label Smoothing

🎯核心定义
Label Smoothing 把 one-hot 标签与均匀分布混合: y=y(1ϵ)+ϵKy' = y(1-\epsilon) + \frac{\epsilon}{K}, 其中 KK 为类别数、ϵ\epsilon 通常取 0.1; 真实类别概率变为 1ϵ+ϵK1-\epsilon+\frac{\epsilon}{K}, 其余类别各得 ϵK\frac{\epsilon}{K}。等价于在交叉熵损失上添加对均匀分布的 KL 惩罚。
💡使用场景
图像分类 (ImageNet 训练标配, Inception/ResNet v2 系列)、Transformer 机器翻译、LLM 预训练/微调中用于抑制过自信 (overconfidence) 并改善校准 (calibration)。面试常问: 公式、为什么防过拟合、对蒸馏的副作用。
解决的核心痛点
阻止模型对 one-hot 标签产生极端 logits (置信度饱和到 1), 提高泛化与校准度。经典副作用 (Müller et al. 2019, When Does Label Smoothing Help?): 平滑后的 teacher 输出中类别间的相对 logit 信息 (“dark knowledge”) 被抹平, 学生蒸馏收益明显下降——后续要做蒸馏时, teacher 训练通常不开 label smoothing。
🎯5 个高频面试考点 (Exam Points)
1
写出 Label Smoothing 公式 y=y(1ϵ)+ϵKy' = y(1-\epsilon) + \frac{\epsilon}{K} 并解释 ϵ\epsilonKK 的作用? ϵ\epsilon 通常取多少?
2
Label Smoothing 为什么能防止过自信 (overconfidence)? 对 logits 大小与模型校准 (calibration) 的影响?
3
为什么 Label Smoothing 会损害知识蒸馏? teacher 输出中的什么信息被平滑抹掉了?
4
Label Smoothing 等价于在交叉熵上添加什么样的正则项? 写出对应的损失函数形式?
5
什么场景不应该用 Label Smoothing? 它与温度缩放 (temperature) 的配合使用?
更新于 2026-08-12
🎯
检验攻克程度:针对「Label Smoothing」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点Dropout下一个知识点权重衰减与 AdamW

🔗 更多 深度学习 知识点卡片

激活函数演进Adam/AdamWAutograd 动态图BatchNorm 批归一化