返回 数理基础 思维导图
中文·English
📐 数理基础ID: entropy-kl

熵 / KL 散度 / 交叉熵

Entropy, KL & Cross-Entropy
🎯核心定义
H(X)=xp(x)logp(x)H(X) = -\sum_x p(x)\log p(x) 度量随机变量的不确定度(最优编码的期望比特数);KL 散度度量两个分布的差异 DKL(PQ)=xp(x)logp(x)q(x)0D_{KL}(P \Vert Q) = \sum_x p(x)\log\frac{p(x)}{q(x)} \ge 0,等号成立当且仅当 P=QP = Q。非负性由 Jensen 不等式证明:log\log 是凹函数,所以 DKL(PQ)=Ep[logq(x)p(x)]logEp[q(x)p(x)]=log1=0D_{KL}(P \Vert Q) = -\mathbb{E}_p\left[\log\frac{q(x)}{p(x)}\right] \ge -\log\mathbb{E}_p\left[\frac{q(x)}{p(x)}\right] = -\log 1 = 0。KL 不对称:取 P=Bern(0.5)P = \text{Bern}(0.5)Q=Bern(0.1)Q = \text{Bern}(0.1),则 DKL(PQ)0.511DKL(QP)0.368D_{KL}(P \Vert Q) \approx 0.511 \neq D_{KL}(Q \Vert P) \approx 0.368,且当 Q(x)=0<P(x)Q(x) = 0 < P(x)DKLD_{KL} \to \infty。交叉熵满足 H(P,Q)=H(P)+DKL(PQ)H(P,Q) = H(P) + D_{KL}(P \Vert Q)
💡使用场景
分布差异是概率机器学习的核心度量 — 分类训练最小化交叉熵、VAE 目标含 DKL(qp)D_{KL}(q \Vert p)、知识蒸馏让学生分布逼近教师、RLHF 用 KL 惩罚约束策略漂移;面试高频题“为什么损失用交叉熵”“证明 KL 非负”都从这里出。
解决的核心痛点
相比 L2 等几何距离,KL 有信息论意义(用 QQ 编码 PP 的多余比特数),并与熵、互信息构成统一框架;但非对称、不满足三角不等式,需要对称距离时须另行构造(如 Jensen-Shannon 散度或 Wasserstein 距离)。
🎯5 个高频面试考点 (Exam Points)
1
证明 KL 散度非负:DKL(PQ)=xp(x)logp(x)q(x)0D_{KL}(P \Vert Q) = \sum_x p(x)\log\frac{p(x)}{q(x)} \ge 0,并说明等号何时成立?
2
KL 散度为什么不对称?给出一个数值例子。
3
熵、交叉熵与 KL 三者的关系?为什么交叉熵损失 = 熵 + KL?
4
KL 满足对称性与三角不等式吗?需要对称距离时用什么?
5
分类、知识蒸馏、RLHF 中 KL 分别出现在哪里?最小化 KL 的几何直觉是什么?
更新于 2026-08-12
🎯
检验攻克程度:针对「熵 / KL 散度 / 交叉熵」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点常用分布族下一个知识点互信息

🔗 更多 数理基础 知识点卡片

Adam/AdamW 偏差修正推导贝叶斯推断偏差方差分解Bootstrap