TalentMe
How To
🗺️
AI Industry Map
NEW
Knowledge ▾
Intro & Usage
Machine Learning Repo
Data Science Repo
Resources ▾
Intro & Usage
AI Tech Vault (Tech Wiki)
Industry News
Tech Blogs
Research Papers
Open Source Projects
Tools Hub ▾
🛠️ Tools & Skills Overview
🌐 Interactive Web Tools
🗺️ AI Industry & Career Map
🧭 AI Career Transition Navigator & Roadmap
📚 AI Multi-Module Practice Hub
🎯 AI Skill Assessment
🧠 AI Skills Library
AI Skills & Prompts Overview
Local Agent Guide
Cloud Skills Templates
⚡ MCP Tools Suite
TalentMe MCP Guide
CLI Tools & Commands
Services ▾
🚀 Services & Plans Suite
🧭 1v1 Coaching & Services
💎 Plans & Pricing
💬 Contact & Consultation
Contact Us
💬 Discord
🌐
中
☀️
🔑
Login / Register
☰
技术知识库
›
复习路线图
›
数理基础 思维导图
›
互信息
← 返回 数理基础 思维导图
中文
·
English
📐 数理基础
ID:
mutual-information
互信息
Mutual Information
🎯
核心定义
互信息度量一个随机变量携带的关于另一个变量的信息量:
I
(
X
;
Y
)
=
H
(
X
)
−
H
(
X
∣
Y
)
=
H
(
Y
)
−
H
(
Y
∣
X
)
=
∑
x
∑
y
p
(
x
,
y
)
log
p
(
x
,
y
)
p
(
x
)
p
(
y
)
≥
0
I(X;Y) = H(X) - H(X|Y) = H(Y) - H(Y|X) = \sum_x \sum_y p(x,y)\log\frac{p(x,y)}{p(x)p(y)} \ge 0
I
(
X
;
Y
)
=
H
(
X
)
−
H
(
X
∣
Y
)
=
H
(
Y
)
−
H
(
Y
∣
X
)
=
∑
x
∑
y
p
(
x
,
y
)
lo
g
p
(
x
)
p
(
y
)
p
(
x
,
y
)
≥
0
。它是联合分布与边缘分布乘积之间的 KL 散度:
I
(
X
;
Y
)
=
D
K
L
(
p
(
x
,
y
)
∥
p
(
x
)
p
(
y
)
)
I(X;Y) = D_{KL}(p(x,y) \Vert p(x)p(y))
I
(
X
;
Y
)
=
D
K
L
(
p
(
x
,
y
)
∥
p
(
x
)
p
(
y
))
,且
I
(
X
;
Y
)
=
0
⟺
X
⊥
Y
I(X;Y) = 0 \iff X \perp Y
I
(
X
;
Y
)
=
0
⟺
X
⊥
Y
。直观上
H
(
X
∣
Y
)
=
H
(
X
)
−
I
(
X
;
Y
)
H(X|Y) = H(X) - I(X;Y)
H
(
X
∣
Y
)
=
H
(
X
)
−
I
(
X
;
Y
)
:知道
Y
Y
Y
后
X
X
X
的不确定性减少的量正是互信息。
💡
使用场景
特征选择(选与标签互信息最高的特征)、决策树信息增益分裂准则、聚类与降维质量评估、生成模型的信息瓶颈分析;面试常以“相关系数为 0 是否一定独立”切入。
⚡
解决的核心痛点
相关系数只捕捉线性关系 — 如
Y
=
X
2
Y = X^2
Y
=
X
2
时相关系数为 0 但互信息很大;互信息捕捉任意(含非线性)依赖且对单调变换不变,是比相关性更完整的依赖度量。代价是连续变量估计困难(需分箱/核密度或变分下界),且小样本下高估偏差明显。
🎯
5 个高频面试考点 (Exam Points)
1
写出互信息的定义及三种等价形式?为什么
I
(
X
;
Y
)
≥
0
I(X;Y) \ge 0
I
(
X
;
Y
)
≥
0
?
2
互信息与相关系数有什么区别?为什么相关系数为 0 不代表独立?
3
I
(
X
;
Y
)
=
0
I(X;Y) = 0
I
(
X
;
Y
)
=
0
的充要条件是什么?与条件熵
H
(
X
∣
Y
)
H(X|Y)
H
(
X
∣
Y
)
的关系?
4
链式法则
I
(
X
,
Y
;
Z
)
=
I
(
X
;
Z
)
+
I
(
Y
;
Z
∣
X
)
I(X,Y;Z) = I(X;Z) + I(Y;Z|X)
I
(
X
,
Y
;
Z
)
=
I
(
X
;
Z
)
+
I
(
Y
;
Z
∣
X
)
的含义?在特征选择中如何应用?
5
给定联合分布
p
(
x
,
y
)
p(x,y)
p
(
x
,
y
)
,如何手算互信息?连续变量如何估计互信息?
📖 关联深度指南:
📄 probability-and-information-theory →
更新于 2026-08-12
🎯
检验攻克程度:针对「互信息」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题 ➔
← 上一个知识点
熵 / KL 散度 / 交叉熵
下一个知识点 →
贝叶斯推断
🔗 更多 数理基础 知识点卡片
Adam/AdamW 偏差修正推导
偏差方差分解
Bootstrap
因果推断与 Rubin 框架