TalentMe
How To
🗺️
AI Industry Map
NEW
Knowledge ▾
Intro & Usage
Machine Learning Repo
Data Science Repo
Resources ▾
Intro & Usage
AI Tech Vault (Tech Wiki)
Industry News
Tech Blogs
Research Papers
Open Source Projects
Tools Hub ▾
🛠️ Tools & Skills Overview
🌐 Interactive Web Tools
🗺️ AI Industry & Career Map
🧭 AI Career Transition Navigator & Roadmap
📚 AI Multi-Module Practice Hub
🎯 AI Skill Assessment
🧠 AI Skills Library
AI Skills & Prompts Overview
Local Agent Guide
Cloud Skills Templates
⚡ MCP Tools Suite
TalentMe MCP Guide
CLI Tools & Commands
Services ▾
🚀 Services & Plans Suite
🧭 1v1 Coaching & Services
💎 Plans & Pricing
💬 Contact & Consultation
Contact Us
💬 Discord
🌐
中
☀️
🔑
Login / Register
☰
技术知识库
›
复习路线图
›
深度学习 思维导图
›
损失函数族
← 返回 深度学习 思维导图
中文
·
English
🧠 深度学习
ID:
loss-functions-dl
损失函数族
Loss Functions
🎯
核心定义
损失函数族决定优化的目标几何与收敛速度。分类标准是交叉熵 CE:
L
=
−
∑
i
y
i
log
p
i
L=-\sum_{i}y_i\log p_i
L
=
−
∑
i
y
i
lo
g
p
i
,二分类退化为 BCE
−
[
y
log
y
^
+
(
1
−
y
)
log
(
1
−
y
^
)
]
-[y\log\hat y+(1-y)\log(1-\hat y)]
−
[
y
lo
g
y
^
+
(
1
−
y
)
lo
g
(
1
−
y
^
)]
;回归用 MSE:
L
=
1
N
∑
∥
y
−
y
^
∥
2
L=\frac{1}{N}\sum\Vert y-\hat y\Vert^2
L
=
N
1
∑
∥
y
−
y
^
∥
2
。两者梯度对比是面试核心: Softmax+CE 的梯度是
p
i
−
y
i
p_i-y_i
p
i
−
y
i
,线性、永不饱和;而 Softmax+MSE 的梯度是
(
p
i
−
y
i
)
p
i
(
1
−
p
i
)
(p_i-y_i)p_i(1-p_i)
(
p
i
−
y
i
)
p
i
(
1
−
p
i
)
,预测极端时
p
(
1
−
p
)
→
0
p(1-p)\to0
p
(
1
−
p
)
→
0
令梯度消失、学习极慢。类别不平衡用 Focal Loss:
F
L
(
p
t
)
=
−
α
t
(
1
−
p
t
)
γ
log
p
t
FL(p_t)=-\alpha_t(1-p_t)^\gamma\log p_t
F
L
(
p
t
)
=
−
α
t
(
1
−
p
t
)
γ
lo
g
p
t
,
γ
=
2
\gamma=2
γ
=
2
时易分样本的权重降到
(
1
−
p
t
)
2
(1-p_t)^2
(
1
−
p
t
)
2
。对比学习用 InfoNCE:
−
log
e
sim
(
q
,
k
+
)
/
τ
∑
j
=
1
K
e
sim
(
q
,
k
j
)
/
τ
-\log\frac{e^{\text{sim}(q,k_+)/\tau}}{\sum_{j=1}^{K}e^{\text{sim}(q,k_j)/\tau}}
−
lo
g
∑
j
=
1
K
e
sim
(
q
,
k
j
)
/
τ
e
sim
(
q
,
k
+
)
/
τ
,温度
τ
\tau
τ
控制负样本惩罚强度;Triplet Loss:
max
(
0
,
d
(
a
,
p
)
−
d
(
a
,
n
)
+
m
)
\max(0,\,d(a,p)-d(a,n)+m)
max
(
0
,
d
(
a
,
p
)
−
d
(
a
,
n
)
+
m
)
,其中
m
m
m
为间隔。
💡
使用场景
面试高频“分类为什么用 CE 而回归用 MSE?”、“CE 与 MSE 在 Softmax 下的梯度差异?”、“Focal Loss 如何解决正负样本不平衡?”、“InfoNCE 的温度参数怎么调?”;目标检测 RetinaNet、对比学习 CLIP/SimCLR、多标签 BCE 都是现场延伸方向。
⚡
解决的核心痛点
收敛速度与鲁棒性——CE 的
log
\log
lo
g
与 Softmax 指数“互相抵消”得出
p
−
y
p-y
p
−
y
的线性梯度,而 MSE 在饱和区梯度被
p
(
1
−
p
)
p(1-p)
p
(
1
−
p
)
压没,同样网络下 CE 收敛可快一个数量级;Focal 用
(
1
−
p
t
)
γ
(1-p_t)^\gamma
(
1
−
p
t
)
γ
压低易分样本(数量占优)的损失贡献,COCO 上 RetinaNet 是首个单阶段超越两阶段的检测器;InfoNCE 的
τ
\tau
τ
决定负样本“难易”权重,直接决定 CLIP/SimCLR 的表征质量。
🎯
5 个高频面试考点 (Exam Points)
1
白板推导 Softmax+CE 梯度
p
i
−
y
i
p_i-y_i
p
i
−
y
i
,并对比 Softmax+MSE 的
(
p
i
−
y
i
)
p
i
(
1
−
p
i
)
(p_i-y_i)p_i(1-p_i)
(
p
i
−
y
i
)
p
i
(
1
−
p
i
)
: 为什么 CE 收敛更快?
2
写出 Focal Loss
F
L
(
p
t
)
=
−
α
t
(
1
−
p
t
)
γ
log
p
t
FL(p_t)=-\alpha_t(1-p_t)^\gamma\log p_t
F
L
(
p
t
)
=
−
α
t
(
1
−
p
t
)
γ
lo
g
p
t
;
γ
=
2
\gamma=2
γ
=
2
时易分样本(
p
t
→
1
p_t\to1
p
t
→
1
)权重如何变化?为什么能解决类别不平衡?
3
写出 InfoNCE 公式并解释温度
τ
\tau
τ
的作用;为什么
τ
\tau
τ
太小会让负样本梯度过强?
4
CE 与 BCE 的关系?多标签分类为什么用 BCE 而非多分类 CE?
5
回归任务为什么不用 CE?MSE / MAE / Huber 的梯度与对离群点鲁棒性对比?
📖 关联深度指南:
📄 activation-functions-and-gradients →
更新于 2026-08-12
🎯
检验攻克程度:针对「损失函数族」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题 ➔
← 上一个知识点
梯度消失/爆炸
下一个知识点 →
BatchNorm 批归一化
🔗 更多 深度学习 知识点卡片
激活函数演进
Adam/AdamW
Autograd 动态图
经典 CNN 演进