M1-013M1: Mathematics & Statistics FundamentalsInformation TheoryMedium
Mastery:
Information Theory: 解释互信息与点互信息(PMI),它们分别用在哪里?
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 互信息衡量两变量共享的信息量;PMI 是单点对的信息贡献,MI 是 PMI 的期望。
📌 Key Takeaways
- •MI=0 当且仅当独立
- •PMI 是词向量(word2vec/GloVe)与词共现分析的基础
- •归一化 PMI(NPMI)便于跨频次比较
📐 Mathematical Derivations
互信息 I(X;Y)=KL(p(x,y)‖p(x)p(y)) 是'联合分布与独立分布的距离',因此 I=0 当且仅当严格独立——这比相关系数强得多,因为相关系数只捕捉线性依赖(例如 Y=X² 时相关系数为 0 但 MI>0)。把它展开即得 I(X;Y)=Σp(x,y)·PMI(x,y)=E[PMI],所以 <strong>PMI 是 MI 的逐点分解</strong>:MI 是 PMI 的期望,PMI 描述单个点对贡献了多少信息。互信息的对称性来自 p(x,y) 的对称性,而非对称的 PMI 也可对称化为 PMI(x,y)+PMI(y,x)。
🏭 Production Trade-offs
两大应用:① <strong>词向量</strong>——word2vec 的 SGNS 目标在数学上等价于分解 PMI 矩阵(Levy & Goldberg 2014 的经典结论),GloVe 则显式拟合 log 共现计数;PMI 的优点是能凸显低频但强关联的词对(因为除以边缘概率),缺点是低频词对 PMI 方差极大,故实践用 <strong>PMI^k</strong>(乘以计数阈值)或 <strong>NPMI</strong>(除以 −log p(x,y) 归一化到 [−1,1]);② <strong>特征选择与因果发现</strong>——MI 用于筛选与目标非线性相关的特征,也是因果发现(PC 算法)中条件独立检验的基础。高维 MI 估计是难点:分箱法偏差大,KSG(k-NN)估计器更常用但维数灾难严重,故实践中常改用 MINE(神经估计)或直接回归预测目标。
⚠️ Common Interview Pitfalls
- ✕用相关系数替代 MI 判断独立性(漏掉非线性依赖)
- ✕对低频词对直接使用 PMI(方差极大、不稳定)
🎯 Interviewer Follow-ups
- ?MI 与相关系数的区别?(MI 能捕捉非线性)
- ?如何高效估计高维 MI?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.