M1-067M1: Mathematics & Statistics FundamentalsInformation TheoryMedium
Mastery:

Information Theory: 解释最大熵原理与它在机器学习中的应用。

📐 Mathematical Definition
max⁡p H(p)=−∑xp(x)log⁡p(x)s.t. Ep[ϕk(x)]=ck\max_p\ H(p)=-\sum_x p(x)\log p(x)\quad \text{s.t.}\ \mathbb E_p[\phi_k(x)]=c_k
⚡ Executive Summary
Core Concept: 在满足已知约束的分布中选熵最大(假设最少)的;导出指数族与逻辑回归等形式。

📌 Key Takeaways

  • •
    无约束时最大熵分布是均匀分布
  • •
    给定均值方差约束时是高斯分布
  • •
    给定均值约束(非负)时是指数分布

📐 Mathematical Derivations

最大熵原理(Jaynes)主张:在已知信息(约束)之外,<strong>不应引入任何额外假设</strong>,故应选择使熵最大(最不确定)的分布。<strong>三个经典结果</strong>:① 无约束(仅要求概率和为 1)→ <strong>均匀分布</strong>;② 约束一阶矩(给定均值)且取值非负 → <strong>指数分布</strong>;③ 约束一阶与二阶矩(给定均值与方差)→ <strong>高斯分布</strong>。这给出了'为什么这些分布如此常见'的信息论解释,也解释了为什么在只知道均值方差时用高斯是<strong>最不武断</strong>的选择。<strong>与指数族的关系</strong>:用拉格朗日乘子法求解最大熵问题,得到的形式恰是<strong>指数族</strong> p(x)∝exp(Σλₖφₖ(x))——因此指数族 ≡ 在给定充分统计量约束下的最大熵分布。

🏭 Production Trade-offs

机器学习中的应用:① <strong>最大熵模型 / 逻辑回归</strong>——分类问题中,给定特征函数 φ(x,y) 的经验期望约束,最大熵解的形式为 p(y|x)∝exp(Σλₖφₖ(x,y)),这正是<strong>逻辑回归(二分类)与 softmax 回归(多分类)</strong>;故逻辑回归可从最大熵原理推导,而非只是'碰巧好用'。② <strong>正则化与先验</strong>——最大熵给出'最少假设'的先验,与贝叶斯中的无信息先验(Jeffreys 先验)相关。③ <strong>结构预测</strong>——HMM/CRF 的对数线性形式源于最大熵;CRF 可视为'序列版的最大熵模型'。④ <strong>强化学习</strong>——<strong>最大熵 RL(Soft Actor-Critic)</strong> 在目标中加入策略熵项,鼓励探索并提升鲁棒性;其最优策略形式为 p(a|s)∝exp(Q(s,a)/α)(玻尔兹曼策略),与最大熵原理一致。⑤ <strong>局限</strong>——最大熵只保证'不引入额外假设',若约束本身选错(如遗漏重要的充分统计量),结果仍会有偏;且计算上需匹配约束(对应模型的训练)。
⚠️ Common Interview Pitfalls
  • ✕
    认为最大熵等于均匀分布(仅在无约束时)
  • ✕
    忽略约束选择对结果的决定性影响
🎯 Interviewer Follow-ups
  • ?
    为什么最大熵 ⇒ 指数族?
  • ?
    逻辑回归与最大熵的关系?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM1-066: Information Theory: 什么是 Wasserstein 距离?为什么 GAN 用它?📋Back to BankNext →M1-068: Information Theory: 解释数据处理不等式与它的含义。