返回 经典机器学习 思维导图
中文·English
📊 经典机器学习ID: confusion-matrix

混淆矩阵

Confusion Matrix
🎯核心定义
二分类评估的基础计数表, 按“真实类别 × 预测类别”把样本分成 4 格: TP (真阳性, 预测为正且实际为正)、FP (假阳性, 预测为正但实际为负, 第 I 类错误)、FN (假阴性, 预测为负但实际为正, 第 II 类错误)、TN (真阴性, 预测为负且实际为负), 总样本 N=TP+FP+FN+TNN = TP + FP + FN + TN。准确率 Acc=TP+TNNAcc = \frac{TP + TN}{N} 是唯一只由对角线决定的指标。数值例: 100 个样本里 95 个负类、5 个正类, 模型全部预测为负, 则 TP=0,FP=0,FN=5,TN=95TP=0, FP=0, FN=5, TN=95, Acc=95/100=95%Acc = 95/100 = 95\%——看起来优秀, 但正类一个都没找到 (召回率 0), 这就是“准确率陷阱”。
💡使用场景
任何分类任务的评估起点; 由这 4 格衍生出 Precision/Recall/F1、特异度、ROC 曲线等全部混淆矩阵类指标; 多分类时扩展为 N×NN \times N 矩阵 (对角线为正确分类), 并派生宏平均/微平均/加权平均。
解决的核心痛点
准确率在不平衡数据上被多数类“绑架” (1% 患病率时全判阴性也有 99% 准确率), 且对 FP/FN 的代价差异视而不见; 混淆矩阵显式暴露两类错误及各自规模。宏平均 (macro) 对每类指标等权平均, MacroP=1Cc=1CPcMacro\,P = \frac{1}{C}\sum_{c=1}^{C}P_c, 小类与大类权重相同; 微平均 (micro) 把所有样本汇总后一次计算, MicroP=cTPcc(TPc+FPc)Micro\,P = \frac{\sum_c TP_c}{\sum_c (TP_c + FP_c)}, 被样本多的类别主导——类别极不平衡且小类重要时选宏平均, 各类样本量均衡或只关心总体表现时选微平均。
🎯5 个高频面试考点 (Exam Points)
1
手算: 给定 TP=40,FP=10,FN=20,TN=30TP=40, FP=10, FN=20, TN=30, 求准确率、Precision、Recall、F1?
2
为什么 1% 患病率的筛查模型“全预测为阴性”时准确率 99% 却不可用? 哪个格子被牺牲了?
3
Type I (FP) 与 Type II (FN) 错误的区别; 垃圾邮件被误拦与漏放分别对应哪个格子?
4
宏平均与微平均如何计算、有何区别; 类别极不平衡 (如 1000:1) 时为何选宏平均?
5
多分类混淆矩阵如何表示与解读 (对角线 / 每行归一 / 加权平均)?
📖 关联深度指南:📄 ml-math-and-eval-metrics
更新于 2026-08-12
🎯
检验攻克程度:针对「混淆矩阵」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点线性链条件随机场下一个知识点Precision/Recall/F1

🔗 更多 经典机器学习 知识点卡片

AdaBoost 算法手推Bagging 与随机森林HMM 参数学习 Baum-WelchGBDT 负梯度拟合