M1-003M1: Mathematics & Statistics FundamentalsProbability FoundationsMedium
Mastery:
Probability Foundations: 什么是独立与条件独立?为什么朴素贝叶斯'错得离谱却常常好用'?
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 独立是 P(A∩B)=P(A)P(B);条件独立是给定 C 后独立。朴素贝叶斯假设特征在类别下条件独立,方差换偏差。
📌 Key Takeaways
- •假设强(几乎从不成立),但分类边界常仍正确
- •参数量从 O(2^n) 降到 O(n),小样本友好
- •概率校准差,但排序(argmax)常可用
📐 Mathematical Derivations
独立性有两个层次:<strong>边缘独立</strong> P(A∩B)=P(A)P(B) 与<strong>条件独立</strong> P(A∩B|C)=P(A|C)P(B|C)。后者弱于前者——'给定 C 后独立'不蕴含'无条件独立',反之亦然(经典例子:两枚硬币由同一个隐变量 C 决定正反,则两枚结果条件独立于 C 但边缘强相关)。朴素贝叶斯只假设<strong>类别条件下特征独立</strong>:P(x|y)=ΠⱼP(xⱼ|y),参数量从 O(2ⁿ) 降到 O(n),使得小样本可估计。数学上它估计的是 P(y|x) ∝ P(y)ΠP(xⱼ|y),与真实后验的差异在于特征间相关被重复计数。
🏭 Production Trade-offs
为什么'错得离谱却好用'?关键洞察来自 Domingos & Pazzani (1997):分类只需要 argmax 正确,而非概率正确。即使独立性假设严重违反,只要<strong>同一类别内的相关结构在各类别间相似</strong>,被重复计数的项在所有类别上近似同倍放大,argmax 不变。这解释了朴素贝叶斯'排序好、校准差'的经典现象。工程含义:NB 适合做<strong>粗筛/召回</strong>而非概率输出;若需概率需做 Platt/Isotonic 校准。相较之下,逻辑回归是判别式(直接建模 P(y|x)),大样本下渐近误差更小但收敛更慢(O(n) vs O(log n))——这是生成式与判别式的经典权衡。
⚠️ Common Interview Pitfalls
- ✕认为条件独立蕴含边缘独立
- ✕把 NB 的概率输出直接当置信度使用
🎯 Interviewer Follow-ups
- ?举例说明条件独立但边缘不独立
- ?如何缓解它的过度自信?(校准/平滑)
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.