TalentMe
How To
🗺️
AI Industry Map
NEW
Knowledge ▾
Intro & Usage
Machine Learning Repo
Data Science Repo
Resources ▾
Intro & Usage
AI Tech Vault (Tech Wiki)
Industry News
Tech Blogs
Research Papers
Open Source Projects
Tools Hub ▾
🛠️ Tools & Skills Overview
🌐 Interactive Web Tools
🗺️ AI Industry & Career Map
🧭 AI Career Transition Navigator & Roadmap
📚 AI Multi-Module Practice Hub
🎯 AI Skill Assessment
🧠 AI Skills Library
AI Skills & Prompts Overview
Local Agent Guide
Cloud Skills Templates
⚡ MCP Tools Suite
TalentMe MCP Guide
CLI Tools & Commands
Services ▾
🚀 Services & Plans Suite
🧭 1v1 Coaching & Services
💎 Plans & Pricing
💬 Contact & Consultation
Contact Us
💬 Discord
🌐
中
☀️
🔑
Login / Register
☰
技术知识库
›
复习路线图
›
经典机器学习 思维导图
›
Huber 与 Focal Loss
← 返回 经典机器学习 思维导图
中文
·
English
📊 经典机器学习
ID:
loss-huber-focal
Huber 与 Focal Loss
Huber Loss & Focal Loss
🎯
核心定义
Huber loss(平滑 L1): 对残差
r
=
y
−
f
(
x
)
r = y - f(x)
r
=
y
−
f
(
x
)
, 小误差用二次、大误差用线性, 分段定义为
L
δ
(
r
)
=
{
1
2
r
2
,
∣
r
∣
≤
δ
δ
(
∣
r
∣
−
1
2
δ
)
,
∣
r
∣
>
δ
\mathcal{L}_\delta(r) = \begin{cases} \frac{1}{2}r^2, & |r| \le \delta \\ \delta(|r| - \frac{1}{2}\delta), & |r| > \delta \end{cases}
L
δ
(
r
)
=
{
2
1
r
2
,
δ
(
∣
r
∣
−
2
1
δ
)
,
∣
r
∣
≤
δ
∣
r
∣
>
δ
——在
∣
r
∣
=
δ
|r| = \delta
∣
r
∣
=
δ
处连续可导, 对大离群点梯度恒定(不爆炸), 对多数样本仍保持 L2 的快速收敛; 目标检测中常以 Smooth L1 形式出现。Focal Loss:
F
L
(
p
t
)
=
−
α
t
(
1
−
p
t
)
γ
log
p
t
FL(p_t) = -\alpha_t (1-p_t)^\gamma \log p_t
F
L
(
p
t
)
=
−
α
t
(
1
−
p
t
)
γ
lo
g
p
t
, 其中
p
t
p_t
p
t
是真实类别的预测概率,
γ
∈
[
0
,
5
]
\gamma \in [0,5]
γ
∈
[
0
,
5
]
为调制因子(常用 2),
α
t
\alpha_t
α
t
为类别权重——当
p
t
→
1
p_t \to 1
p
t
→
1
(易分样本)时
(
1
−
p
t
)
γ
→
0
(1-p_t)^\gamma \to 0
(
1
−
p
t
)
γ
→
0
, 损失被急剧压低; 当
p
t
p_t
p
t
小(难分样本)时权重接近 1, 损失保留, 由 RetinaNet 提出解决“易分负样本淹没梯度”的问题。
💡
使用场景
Huber/Smooth L1 — 回归任务含离群点、需要梯度稳定的场景(目标检测框回归、坐标回归); Focal — 稠密目标检测、类别极不平衡的分类(背景框 vs 目标框可达 1:1000)。
⚡
解决的核心痛点
对离群点, MSE 梯度随误差线性增长、单个异常样本就能主导梯度, MAE 虽鲁棒但在 0 处不可导且小误差时梯度恒定、收敛慢; Huber 在两者间折中——小误差 L2 收敛快、大误差 L1 梯度被截断在
±
δ
\pm\delta
±
δ
内, 既鲁棒又处处可导。Focal 解决“大量易分负样本(如背景)贡献了绝大部分 CE 损失、梯度被稀释”: 调制因子把易分样本的贡献指数级压低, 使训练注意力转向少数难分正样本, 与重采样/class weight 互补而非替代。
🎯
5 个高频面试考点 (Exam Points)
1
写出 Huber loss 分段公式
L
δ
(
r
)
\mathcal{L}_\delta(r)
L
δ
(
r
)
; δ 的作用是什么? 为什么说它在
∣
r
∣
=
δ
|r|=\delta
∣
r
∣
=
δ
处连续可导?
2
Huber 与 MSE/MAE 对比: 对离群点梯度、原点可导性、收敛速度各有什么特点?
3
写出 Focal loss 公式
F
L
(
p
t
)
=
−
α
t
(
1
−
p
t
)
γ
log
p
t
FL(p_t) = -\alpha_t(1-p_t)^\gamma \log p_t
F
L
(
p
t
)
=
−
α
t
(
1
−
p
t
)
γ
lo
g
p
t
; γ 与 α 各自的作用?
4
为什么 Focal loss 能缓解类别不平衡? 它与重采样、class weight 是替代还是互补关系?
5
Smooth L1 与 Huber 的关系? 目标检测为什么框回归用 Smooth L1 而不是 MSE?
📖 关联深度指南:
📄 ml-math-and-eval-metrics →
更新于 2026-08-12
🎯
检验攻克程度:针对「Huber 与 Focal Loss」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题 ➔
← 上一个知识点
重采样方法 SMOTE/ADASYN/Tomek
下一个知识点 →
目标编码 Target Encoding
🔗 更多 经典机器学习 知识点卡片
AdaBoost 算法手推
Bagging 与随机森林
HMM 参数学习 Baum-Welch
GBDT 负梯度拟合