返回 经典机器学习 思维导图
中文·English
📊 经典机器学习ID: naive-bayes

朴素贝叶斯

Naive Bayes
🎯核心定义
朴素贝叶斯是基于贝叶斯定理的生成式分类器,核心假设是给定类别 CC 时各特征条件独立。由贝叶斯定理
📌核心概述
P(Cx)P(C)iP(xiC)P(C \mid x) \propto P(C)\prod_{i} P(x_i \mid C)
📌核心概述
先验 P(C)P(C) 与各特征似然的乘积决定后验,取后验最大者为预测类;归一化分母 P(x)P(x) 对所有类别相同,可在 argmax 中约去。参数估计方式决定三种变体:多项式朴素贝叶斯(计数特征、多项分布,适合词频文本)、高斯朴素贝叶斯(连续特征拟合 P(xiC)=N(xi;μC,i,σC,i2)P(x_i \mid C) = \mathcal{N}(x_i; \mu_{C,i}, \sigma_{C,i}^2))、伯努利朴素贝叶斯(0/1 二值特征、伯努利分布)。若某“特征-类别”组合在训练集中计数为 0,乘积后验将整体为 0,故用拉普拉斯平滑
📌核心概述
P^(xiy)=Ny,xi+αNy+αV\hat P(x_i \mid y) = \frac{N_{y,x_i} + \alpha}{N_y + \alpha |V|}
📌核心概述
其中 NyN_y 为类别 yy 的样本数、Ny,xiN_{y,x_i} 为类别 yy 中特征 xix_i 出现次数、V|V| 为特征取值数,取 α=1\alpha = 1 即加一平滑。
💡使用场景
文本分类(垃圾邮件、情感分析)、高维稀疏特征的快速基线、在线增量学习;面试常考条件独立假设的推导、与逻辑回归的对比。
解决的核心痛点
在高维离散特征上以生成式视角建模,参数个数随特征数线性增长,无需迭代训练、支持流式增量更新;代价是条件独立假设过强 — 特征强相关时概率估计有偏,但分类决策边界往往仍可接受,且对噪声特征稳健。
🎯5 个高频面试考点 (Exam Points)
1
写出朴素贝叶斯分类公式 P(Cx)P(C)iP(xiC)P(C \mid x) \propto P(C)\prod_i P(x_i \mid C),并说明“朴素”假设是什么、分母 P(x)P(x) 为什么可省略?
2
为什么需要拉普拉斯平滑?写出平滑公式 P^=Ny,xi+αNy+αV\hat P = \frac{N_{y,x_i}+\alpha}{N_y+\alpha|V|},零概率如何被避免?
3
多项式、高斯、伯努利三种朴素贝叶斯变体分别适用于什么类型的特征?
4
朴素贝叶斯是生成式还是判别式?与逻辑回归在小数据、特征相关性强时表现有何不同?
5
条件独立假设被违反时会发生什么?为什么现实任务中它仍常给出可用的分类结果?
📖 关联深度指南:📄 probabilistic-models
更新于 2026-08-12
🎯
检验攻克程度:针对「朴素贝叶斯」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点PCA 与 SVD下一个知识点HMM 前向算法 (评估)

🔗 更多 经典机器学习 知识点卡片

AdaBoost 算法手推Bagging 与随机森林HMM 参数学习 Baum-WelchGBDT 负梯度拟合