M2-042M2: Classical Machine LearningNaive BayesEasy
Mastery:
Naive Bayes: 为什么需要拉普拉斯平滑?给出公式。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 防止某特征未在类中出现导致概率为 0、整乘积归零。
📌 Key Takeaways
- •α=1 即拉普拉斯平滑
- •α<1 为 Lidstone 平滑
📐 Mathematical Derivations
零概率问题:若某特征值在训练集的某类别中从未出现(N_{jy}=0),则 P(xⱼ|y)=0,导致整个乘积 ΠP(xⱼ|y)=0,该类别被完全排除——即使其他所有特征都强烈支持它。这对稀有特征与测试集中出现的新值尤其致命。<strong>拉普拉斯平滑</strong>(α=1)的解法是给每个计数加 1:P(xⱼ|y)=(N_{jy}+1)/(N_y+|V|),其中 |V| 是特征取值数(分母加 |V| 保证概率和为 1)。一般形式(Lidstone 平滑)用 α 替代 1:P=(N_{jy}+α)/(N_y+α|V|)。<strong>贝叶斯解释</strong>:拉普拉斯平滑等价于给每个特征取值加一个均匀先验(Dirichlet(α,…,α) 先验的 MAP 估计),α 是'伪计数'。
🏭 Production Trade-offs
实践要点:① <strong>α 的选择</strong>——α=1(拉普拉斯)最常见;α<1(如 0.1、0.01)在数据量大时更优(弱先验,减少偏差);α 过大会过度平滑(把分布拉向均匀,损失信息)。可用交叉验证选 α。② <strong>对多项/伯努利 NB 的差异</strong>——多项 NB 的分母是 N_y+α|V|(|V| 为词表大小),伯努利 NB 的分母是 N_y+2α(每个特征只有出现/不出现两种取值,需显式建模'不出现')。③ <strong>与零概率的替代方案</strong>——也可用'未见词回退到全局频率'或'加一个小的全局概率下限',但平滑更系统。④ <strong>平滑的必要性随数据量下降</strong>——大数据下未出现值很少,α 的影响小;小数据或高基数特征(如文本词表)下平滑至关重要。
⚠️ Common Interview Pitfalls
- ✕不做平滑导致零概率归零
- ✕α 过大过度平滑(把分布拉向均匀)
🎯 Interviewer Follow-ups
- ?α 如何选择?
- ?平滑与先验的关系?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.