M1-011M1: Mathematics & Statistics FundamentalsInformation TheoryEasy
Mastery:
Information Theory: 定义信息量(自信息)、熵、交叉熵、KL 散度,并说明相互关系。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 自信息是 -log p;熵是自信息的期望;交叉熵 = 熵 + KL。
📌 Key Takeaways
- •熵 = 最优编码的平均长度(不确定度)
- •交叉熵 ≥ 熵,等号当且仅当 p=q
- •KL ≥ 0(Gibbs 不等式),且不对称
📐 Mathematical Derivations
四个量的关系是层层递进的:<strong>自信息</strong> I(x)=−log p(x) 度量'看到某个具体结果的惊讶程度'(概率越小惊讶越大);<strong>熵</strong> H(p)=E_p[−log p(x)] 是这个惊讶程度的期望,即'平均不确定性',也是 Shannon 编码定理给出的最优平均码长下界;<strong>交叉熵</strong> H(p,q)=−Σp log q 是用分布 q 去编码真实分布 p 时的平均码长,它 ≥ H(p);<strong>KL 散度</strong> KL(p‖q)=H(p,q)−H(p) 正是这个'多出来的码长',度量两个分布的差异。因此训练时最小化交叉熵 ≡ 最小化 KL(因为 H(p) 与参数无关是常数)——这就是为什么分类任务用交叉熵等价于 MLE。Gibbs 不等式 KL≥0 可由 Jensen 不等式证明。
🏭 Production Trade-offs
工程上的两个要点:① <strong>交叉熵与 KL 的等价性只对固定 p 成立</strong>——若 p 也随模型变化(如蒸馏中教师也更新、或 VAE 中两个分布都含参数),则必须显式区分。知识蒸馏的损失就是 KL(p_teacher‖p_student) 而非交叉熵,因为教师分布是软的、携带暗知识。② <strong>KL 不对称有实际后果</strong>:前向 KL(p‖q) 是 mean-seeking(q 必须覆盖 p 的所有支撑,否则 log(p/q) 中 p>0 而 q≈0 处惩罚趋于无穷),反向 KL(q‖p) 是 mode-seeking(q 会收缩到 p 的某个众数)。变分推断用反向 KL 故倾向欠估计方差,这解释了 VAE 生成偏模糊的现象。
⚠️ Common Interview Pitfalls
- ✕把交叉熵与 KL 完全等同(仅当第一项分布固定时成立)
- ✕忽略 KL 的非对称性,导致变分推断中的方差塌缩误判
🎯 Interviewer Follow-ups
- ?为什么训练用交叉熵而不是 KL?(p 固定,两者差常数)
- ?KL 不对称会导致什么实际差异?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.