M1-013M1: Mathematics & Statistics FundamentalsInformation TheoryMedium
Mastery:

Information Theory: 解释互信息与点互信息(PMI),它们分别用在哪里?

📐 Mathematical Definition
I(X;Y)=∑x,yp(x,y)log⁡p(x,y)p(x)p(y),PMI(x,y)=log⁡p(x,y)p(x)p(y)I(X;Y)=\sum_{x,y}p(x,y)\log\frac{p(x,y)}{p(x)p(y)},\qquad \mathrm{PMI}(x,y)=\log\frac{p(x,y)}{p(x)p(y)}
⚡ Executive Summary
Core Concept: 互信息衡量两变量共享的信息量;PMI 是单点对的信息贡献,MI 是 PMI 的期望。

📌 Key Takeaways

  • •
    MI=0 当且仅当独立
  • •
    PMI 是词向量(word2vec/GloVe)与词共现分析的基础
  • •
    归一化 PMI(NPMI)便于跨频次比较

📐 Mathematical Derivations

互信息 I(X;Y)=KL(p(x,y)‖p(x)p(y)) 是'联合分布与独立分布的距离',因此 I=0 当且仅当严格独立——这比相关系数强得多,因为相关系数只捕捉线性依赖(例如 Y=X² 时相关系数为 0 但 MI>0)。把它展开即得 I(X;Y)=Σp(x,y)·PMI(x,y)=E[PMI],所以 <strong>PMI 是 MI 的逐点分解</strong>:MI 是 PMI 的期望,PMI 描述单个点对贡献了多少信息。互信息的对称性来自 p(x,y) 的对称性,而非对称的 PMI 也可对称化为 PMI(x,y)+PMI(y,x)。

🏭 Production Trade-offs

两大应用:① <strong>词向量</strong>——word2vec 的 SGNS 目标在数学上等价于分解 PMI 矩阵(Levy & Goldberg 2014 的经典结论),GloVe 则显式拟合 log 共现计数;PMI 的优点是能凸显低频但强关联的词对(因为除以边缘概率),缺点是低频词对 PMI 方差极大,故实践用 <strong>PMI^k</strong>(乘以计数阈值)或 <strong>NPMI</strong>(除以 −log p(x,y) 归一化到 [−1,1]);② <strong>特征选择与因果发现</strong>——MI 用于筛选与目标非线性相关的特征,也是因果发现(PC 算法)中条件独立检验的基础。高维 MI 估计是难点:分箱法偏差大,KSG(k-NN)估计器更常用但维数灾难严重,故实践中常改用 MINE(神经估计)或直接回归预测目标。
⚠️ Common Interview Pitfalls
  • ✕
    用相关系数替代 MI 判断独立性(漏掉非线性依赖)
  • ✕
    对低频词对直接使用 PMI(方差极大、不稳定)
🎯 Interviewer Follow-ups
  • ?
    MI 与相关系数的区别?(MI 能捕捉非线性)
  • ?
    如何高效估计高维 MI?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM1-012: Information Theory: KL 散度为什么不对称?前向与反向 KL 在优化上有什么区别?📋Back to BankNext →M1-014: Information Theory: 交叉熵损失与最大似然估计为什么等价?