返回 深度学习 思维导图
中文·English
🧠 深度学习ID: loss-functions-dl

损失函数族

Loss Functions
🎯核心定义
损失函数族决定优化的目标几何与收敛速度。分类标准是交叉熵 CE: L=iyilogpiL=-\sum_{i}y_i\log p_i,二分类退化为 BCE [ylogy^+(1y)log(1y^)]-[y\log\hat y+(1-y)\log(1-\hat y)];回归用 MSE: L=1Nyy^2L=\frac{1}{N}\sum\Vert y-\hat y\Vert^2。两者梯度对比是面试核心: Softmax+CE 的梯度是 piyip_i-y_i,线性、永不饱和;而 Softmax+MSE 的梯度是 (piyi)pi(1pi)(p_i-y_i)p_i(1-p_i),预测极端时 p(1p)0p(1-p)\to0 令梯度消失、学习极慢。类别不平衡用 Focal Loss: FL(pt)=αt(1pt)γlogptFL(p_t)=-\alpha_t(1-p_t)^\gamma\log p_t,γ=2\gamma=2 时易分样本的权重降到 (1pt)2(1-p_t)^2。对比学习用 InfoNCE: logesim(q,k+)/τj=1Kesim(q,kj)/τ-\log\frac{e^{\text{sim}(q,k_+)/\tau}}{\sum_{j=1}^{K}e^{\text{sim}(q,k_j)/\tau}},温度 τ\tau 控制负样本惩罚强度;Triplet Loss: max(0,d(a,p)d(a,n)+m)\max(0,\,d(a,p)-d(a,n)+m),其中 mm 为间隔。
💡使用场景
面试高频“分类为什么用 CE 而回归用 MSE?”、“CE 与 MSE 在 Softmax 下的梯度差异?”、“Focal Loss 如何解决正负样本不平衡?”、“InfoNCE 的温度参数怎么调?”;目标检测 RetinaNet、对比学习 CLIP/SimCLR、多标签 BCE 都是现场延伸方向。
解决的核心痛点
收敛速度与鲁棒性——CE 的 log\log 与 Softmax 指数“互相抵消”得出 pyp-y 的线性梯度,而 MSE 在饱和区梯度被 p(1p)p(1-p) 压没,同样网络下 CE 收敛可快一个数量级;Focal 用 (1pt)γ(1-p_t)^\gamma 压低易分样本(数量占优)的损失贡献,COCO 上 RetinaNet 是首个单阶段超越两阶段的检测器;InfoNCE 的 τ\tau 决定负样本“难易”权重,直接决定 CLIP/SimCLR 的表征质量。
🎯5 个高频面试考点 (Exam Points)
1
白板推导 Softmax+CE 梯度 piyip_i-y_i,并对比 Softmax+MSE 的 (piyi)pi(1pi)(p_i-y_i)p_i(1-p_i): 为什么 CE 收敛更快?
2
写出 Focal Loss FL(pt)=αt(1pt)γlogptFL(p_t)=-\alpha_t(1-p_t)^\gamma\log p_t;γ=2\gamma=2 时易分样本(pt1p_t\to1)权重如何变化?为什么能解决类别不平衡?
3
写出 InfoNCE 公式并解释温度 τ\tau 的作用;为什么 τ\tau 太小会让负样本梯度过强?
4
CE 与 BCE 的关系?多标签分类为什么用 BCE 而非多分类 CE?
5
回归任务为什么不用 CE?MSE / MAE / Huber 的梯度与对离群点鲁棒性对比?
更新于 2026-08-12
🎯
检验攻克程度:针对「损失函数族」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点梯度消失/爆炸下一个知识点BatchNorm 批归一化

🔗 更多 深度学习 知识点卡片

激活函数演进Adam/AdamWAutograd 动态图经典 CNN 演进