M1-011M1: Mathematics & Statistics FundamentalsInformation TheoryEasy
Mastery:

Information Theory: 定义信息量(自信息)、熵、交叉熵、KL 散度,并说明相互关系。

📐 Mathematical Definition
H(p)=−∑xp(x)log⁡p(x),H(p,q)=−∑xp(x)log⁡q(x),KL(p∥q)=H(p,q)−H(p)H(p)=-\sum_x p(x)\log p(x),\quad H(p,q)=-\sum_x p(x)\log q(x),\quad \mathrm{KL}(p\|q)=H(p,q)-H(p)
⚡ Executive Summary
Core Concept: 自信息是 -log p;熵是自信息的期望;交叉熵 = 熵 + KL。

📌 Key Takeaways

  • •
    熵 = 最优编码的平均长度(不确定度)
  • •
    交叉熵 ≥ 熵,等号当且仅当 p=q
  • •
    KL ≥ 0(Gibbs 不等式),且不对称

📐 Mathematical Derivations

四个量的关系是层层递进的:<strong>自信息</strong> I(x)=−log p(x) 度量'看到某个具体结果的惊讶程度'(概率越小惊讶越大);<strong>熵</strong> H(p)=E_p[−log p(x)] 是这个惊讶程度的期望,即'平均不确定性',也是 Shannon 编码定理给出的最优平均码长下界;<strong>交叉熵</strong> H(p,q)=−Σp log q 是用分布 q 去编码真实分布 p 时的平均码长,它 ≥ H(p);<strong>KL 散度</strong> KL(p‖q)=H(p,q)−H(p) 正是这个'多出来的码长',度量两个分布的差异。因此训练时最小化交叉熵 ≡ 最小化 KL(因为 H(p) 与参数无关是常数)——这就是为什么分类任务用交叉熵等价于 MLE。Gibbs 不等式 KL≥0 可由 Jensen 不等式证明。

🏭 Production Trade-offs

工程上的两个要点:① <strong>交叉熵与 KL 的等价性只对固定 p 成立</strong>——若 p 也随模型变化(如蒸馏中教师也更新、或 VAE 中两个分布都含参数),则必须显式区分。知识蒸馏的损失就是 KL(p_teacher‖p_student) 而非交叉熵,因为教师分布是软的、携带暗知识。② <strong>KL 不对称有实际后果</strong>:前向 KL(p‖q) 是 mean-seeking(q 必须覆盖 p 的所有支撑,否则 log(p/q) 中 p>0 而 q≈0 处惩罚趋于无穷),反向 KL(q‖p) 是 mode-seeking(q 会收缩到 p 的某个众数)。变分推断用反向 KL 故倾向欠估计方差,这解释了 VAE 生成偏模糊的现象。
⚠️ Common Interview Pitfalls
  • ✕
    把交叉熵与 KL 完全等同(仅当第一项分布固定时成立)
  • ✕
    忽略 KL 的非对称性,导致变分推断中的方差塌缩误判
🎯 Interviewer Follow-ups
  • ?
    为什么训练用交叉熵而不是 KL?(p 固定,两者差常数)
  • ?
    KL 不对称会导致什么实际差异?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM1-010: Common Distributions: 什么是重尾分布?它对均值估计和 A/B 测试有什么影响?📋Back to BankNext →M1-012: Information Theory: KL 散度为什么不对称?前向与反向 KL 在优化上有什么区别?