返回 数理基础 思维导图
中文·English
📐 数理基础ID: mutual-information

互信息

Mutual Information
🎯核心定义
互信息度量一个随机变量携带的关于另一个变量的信息量: I(X;Y)=H(X)H(XY)=H(Y)H(YX)=xyp(x,y)logp(x,y)p(x)p(y)0I(X;Y) = H(X) - H(X|Y) = H(Y) - H(Y|X) = \sum_x \sum_y p(x,y)\log\frac{p(x,y)}{p(x)p(y)} \ge 0。它是联合分布与边缘分布乘积之间的 KL 散度:I(X;Y)=DKL(p(x,y)p(x)p(y))I(X;Y) = D_{KL}(p(x,y) \Vert p(x)p(y)),且 I(X;Y)=0    XYI(X;Y) = 0 \iff X \perp Y。直观上 H(XY)=H(X)I(X;Y)H(X|Y) = H(X) - I(X;Y):知道 YYXX 的不确定性减少的量正是互信息。
💡使用场景
特征选择(选与标签互信息最高的特征)、决策树信息增益分裂准则、聚类与降维质量评估、生成模型的信息瓶颈分析;面试常以“相关系数为 0 是否一定独立”切入。
解决的核心痛点
相关系数只捕捉线性关系 — 如 Y=X2Y = X^2 时相关系数为 0 但互信息很大;互信息捕捉任意(含非线性)依赖且对单调变换不变,是比相关性更完整的依赖度量。代价是连续变量估计困难(需分箱/核密度或变分下界),且小样本下高估偏差明显。
🎯5 个高频面试考点 (Exam Points)
1
写出互信息的定义及三种等价形式?为什么 I(X;Y)0I(X;Y) \ge 0?
2
互信息与相关系数有什么区别?为什么相关系数为 0 不代表独立?
3
I(X;Y)=0I(X;Y) = 0 的充要条件是什么?与条件熵 H(XY)H(X|Y) 的关系?
4
链式法则 I(X,Y;Z)=I(X;Z)+I(Y;ZX)I(X,Y;Z) = I(X;Z) + I(Y;Z|X) 的含义?在特征选择中如何应用?
5
给定联合分布 p(x,y)p(x,y),如何手算互信息?连续变量如何估计互信息?
更新于 2026-08-12
🎯
检验攻克程度:针对「互信息」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点熵 / KL 散度 / 交叉熵下一个知识点贝叶斯推断

🔗 更多 数理基础 知识点卡片

Adam/AdamW 偏差修正推导偏差方差分解Bootstrap因果推断与 Rubin 框架