M2-042M2: Classical Machine LearningNaive BayesEasy
Mastery:

Naive Bayes: 为什么需要拉普拉斯平滑?给出公式。

📐 Mathematical Definition
P(xj∣y)=Njy+αNy+α∣V∣P(x_j\mid y)=\frac{N_{jy}+\alpha}{N_y+\alpha|V|}
⚡ Executive Summary
Core Concept: 防止某特征未在类中出现导致概率为 0、整乘积归零。

📌 Key Takeaways

  • •
    α=1 即拉普拉斯平滑
  • •
    α<1 为 Lidstone 平滑

📐 Mathematical Derivations

零概率问题:若某特征值在训练集的某类别中从未出现(N_{jy}=0),则 P(xⱼ|y)=0,导致整个乘积 ΠP(xⱼ|y)=0,该类别被完全排除——即使其他所有特征都强烈支持它。这对稀有特征与测试集中出现的新值尤其致命。<strong>拉普拉斯平滑</strong>(α=1)的解法是给每个计数加 1:P(xⱼ|y)=(N_{jy}+1)/(N_y+|V|),其中 |V| 是特征取值数(分母加 |V| 保证概率和为 1)。一般形式(Lidstone 平滑)用 α 替代 1:P=(N_{jy}+α)/(N_y+α|V|)。<strong>贝叶斯解释</strong>:拉普拉斯平滑等价于给每个特征取值加一个均匀先验(Dirichlet(α,…,α) 先验的 MAP 估计),α 是'伪计数'。

🏭 Production Trade-offs

实践要点:① <strong>α 的选择</strong>——α=1(拉普拉斯)最常见;α<1(如 0.1、0.01)在数据量大时更优(弱先验,减少偏差);α 过大会过度平滑(把分布拉向均匀,损失信息)。可用交叉验证选 α。② <strong>对多项/伯努利 NB 的差异</strong>——多项 NB 的分母是 N_y+α|V|(|V| 为词表大小),伯努利 NB 的分母是 N_y+2α(每个特征只有出现/不出现两种取值,需显式建模'不出现')。③ <strong>与零概率的替代方案</strong>——也可用'未见词回退到全局频率'或'加一个小的全局概率下限',但平滑更系统。④ <strong>平滑的必要性随数据量下降</strong>——大数据下未出现值很少,α 的影响小;小数据或高基数特征(如文本词表)下平滑至关重要。
⚠️ Common Interview Pitfalls
  • ✕
    不做平滑导致零概率归零
  • ✕
    α 过大过度平滑(把分布拉向均匀)
🎯 Interviewer Follow-ups
  • ?
    α 如何选择?
  • ?
    平滑与先验的关系?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM2-041: Naive Bayes: 写出朴素贝叶斯的分类决策式,并说明'朴素'指什么。📋Back to BankNext →M2-043: Naive Bayes: 比较高斯、多项式、伯努利三种朴素贝叶斯。