TalentMe
How To
🗺️
AI Industry Map
NEW
Knowledge ▾
Intro & Usage
Machine Learning Repo
Data Science Repo
Resources ▾
Intro & Usage
AI Tech Vault (Tech Wiki)
Industry News
Tech Blogs
Research Papers
Open Source Projects
Tools Hub ▾
🛠️ Tools & Skills Overview
🌐 Interactive Web Tools
🗺️ AI Industry & Career Map
🧭 AI Career Transition Navigator & Roadmap
📚 AI Multi-Module Practice Hub
🎯 AI Skill Assessment
🧠 AI Skills Library
AI Skills & Prompts Overview
Local Agent Guide
Cloud Skills Templates
⚡ MCP Tools Suite
TalentMe MCP Guide
CLI Tools & Commands
Services ▾
🚀 Services & Plans Suite
🧭 1v1 Coaching & Services
💎 Plans & Pricing
💬 Contact & Consultation
Contact Us
💬 Discord
🌐
中
☀️
🔑
Login / Register
☰
技术知识库
›
复习路线图
›
数理基础 思维导图
›
熵 / KL 散度 / 交叉熵
← 返回 数理基础 思维导图
中文
·
English
📐 数理基础
ID:
entropy-kl
熵 / KL 散度 / 交叉熵
Entropy, KL & Cross-Entropy
🎯
核心定义
熵
H
(
X
)
=
−
∑
x
p
(
x
)
log
p
(
x
)
H(X) = -\sum_x p(x)\log p(x)
H
(
X
)
=
−
∑
x
p
(
x
)
lo
g
p
(
x
)
度量随机变量的不确定度(最优编码的期望比特数);KL 散度度量两个分布的差异
D
K
L
(
P
∥
Q
)
=
∑
x
p
(
x
)
log
p
(
x
)
q
(
x
)
≥
0
D_{KL}(P \Vert Q) = \sum_x p(x)\log\frac{p(x)}{q(x)} \ge 0
D
K
L
(
P
∥
Q
)
=
∑
x
p
(
x
)
lo
g
q
(
x
)
p
(
x
)
≥
0
,等号成立当且仅当
P
=
Q
P = Q
P
=
Q
。非负性由 Jensen 不等式证明:
log
\log
lo
g
是凹函数,所以
D
K
L
(
P
∥
Q
)
=
−
E
p
[
log
q
(
x
)
p
(
x
)
]
≥
−
log
E
p
[
q
(
x
)
p
(
x
)
]
=
−
log
1
=
0
D_{KL}(P \Vert Q) = -\mathbb{E}_p\left[\log\frac{q(x)}{p(x)}\right] \ge -\log\mathbb{E}_p\left[\frac{q(x)}{p(x)}\right] = -\log 1 = 0
D
K
L
(
P
∥
Q
)
=
−
E
p
[
lo
g
p
(
x
)
q
(
x
)
]
≥
−
lo
g
E
p
[
p
(
x
)
q
(
x
)
]
=
−
lo
g
1
=
0
。KL 不对称:取
P
=
Bern
(
0.5
)
P = \text{Bern}(0.5)
P
=
Bern
(
0.5
)
、
Q
=
Bern
(
0.1
)
Q = \text{Bern}(0.1)
Q
=
Bern
(
0.1
)
,则
D
K
L
(
P
∥
Q
)
≈
0.511
≠
D
K
L
(
Q
∥
P
)
≈
0.368
D_{KL}(P \Vert Q) \approx 0.511 \neq D_{KL}(Q \Vert P) \approx 0.368
D
K
L
(
P
∥
Q
)
≈
0.511
=
D
K
L
(
Q
∥
P
)
≈
0.368
,且当
Q
(
x
)
=
0
<
P
(
x
)
Q(x) = 0 < P(x)
Q
(
x
)
=
0
<
P
(
x
)
时
D
K
L
→
∞
D_{KL} \to \infty
D
K
L
→
∞
。交叉熵满足
H
(
P
,
Q
)
=
H
(
P
)
+
D
K
L
(
P
∥
Q
)
H(P,Q) = H(P) + D_{KL}(P \Vert Q)
H
(
P
,
Q
)
=
H
(
P
)
+
D
K
L
(
P
∥
Q
)
。
💡
使用场景
分布差异是概率机器学习的核心度量 — 分类训练最小化交叉熵、VAE 目标含
D
K
L
(
q
∥
p
)
D_{KL}(q \Vert p)
D
K
L
(
q
∥
p
)
、知识蒸馏让学生分布逼近教师、RLHF 用 KL 惩罚约束策略漂移;面试高频题“为什么损失用交叉熵”“证明 KL 非负”都从这里出。
⚡
解决的核心痛点
相比 L2 等几何距离,KL 有信息论意义(用
Q
Q
Q
编码
P
P
P
的多余比特数),并与熵、互信息构成统一框架;但非对称、不满足三角不等式,需要对称距离时须另行构造(如 Jensen-Shannon 散度或 Wasserstein 距离)。
🎯
5 个高频面试考点 (Exam Points)
1
证明 KL 散度非负:
D
K
L
(
P
∥
Q
)
=
∑
x
p
(
x
)
log
p
(
x
)
q
(
x
)
≥
0
D_{KL}(P \Vert Q) = \sum_x p(x)\log\frac{p(x)}{q(x)} \ge 0
D
K
L
(
P
∥
Q
)
=
∑
x
p
(
x
)
lo
g
q
(
x
)
p
(
x
)
≥
0
,并说明等号何时成立?
2
KL 散度为什么不对称?给出一个数值例子。
3
熵、交叉熵与 KL 三者的关系?为什么交叉熵损失 = 熵 + KL?
4
KL 满足对称性与三角不等式吗?需要对称距离时用什么?
5
分类、知识蒸馏、RLHF 中 KL 分别出现在哪里?最小化 KL 的几何直觉是什么?
📖 关联深度指南:
📄 probability-and-information-theory →
更新于 2026-08-12
🎯
检验攻克程度:针对「熵 / KL 散度 / 交叉熵」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题 ➔
← 上一个知识点
常用分布族
下一个知识点 →
互信息
🔗 更多 数理基础 知识点卡片
Adam/AdamW 偏差修正推导
贝叶斯推断
偏差方差分解
Bootstrap