返回 经典机器学习 思维导图
中文·English
📊 经典机器学习ID: multiclass-strategies

多分类 OvR/OvO/Softmax

Multiclass Strategies: OvR/OvO/Softmax
🎯核心定义
把二分类器扩展到 KK 类有三种主流策略。OvR (一对余): 训练 KK 个“该类 vs 其余”的分类器, 预测取得分最高者, 参数量 O(Kd)O(K \cdot d); OvO (一对一): 训练 (K2)=K(K1)2\binom{K}{2} = \frac{K(K-1)}{2} 个两两分类器, 投票裁决, 单模型更简单但总成本 O(K2)O(K^2); Softmax (直接多分类): 单个模型输出 KK 维概率 pi=ezi/τj=1Kezj/τp_i = \frac{e^{z_i/\tau}}{\sum_{j=1}^{K} e^{z_j/\tau}}, 温度 τ\tau 控制平滑度——τ0\tau \to 0 退化为 argmax, τ\tau \to \infty 趋于均匀分布; 配合交叉熵损失梯度仍为 pyp - y (Softmax 是多分类的 Logistic)。
💡使用场景
面试常考三者对比 (模型数/参数量/表达能力)、温度 τ\tau 在知识蒸馏与概率校准中的作用、OvR 得分为何不能当概率。
解决的核心痛点
OvR 每类只拿“自己 vs 其余”训练, 类别不平衡严重且 KK 个分类器得分不可比 (需校准, 如 Platt scaling); OvO 在 KK 大时模型数随 (K2)\binom{K}{2} 爆炸 (K=100K=100 要 4950 个模型), 且投票可能平票; Softmax 单模型端到端训练、天然输出合法概率, 但要求类别互斥 (非互斥任务用多个二分类)。温度 τ\tau 额外提供分布塑形能力: 蒸馏时 τ>1\tau > 1 软化标签传递暗知识, 推理用 τ=1\tau = 1; τ\tau 也影响预测置信度与校准质量。
🎯5 个高频面试考点 (Exam Points)
1
OvR vs OvO 对比: 模型数量 (KK vs K(K1)2\frac{K(K-1)}{2})、训练/推理成本、投票平局问题, K=100K=100 时各需要多少个模型?
2
Softmax 温度 τ\tau 的作用: 推导 τ0\tau \to 0τ\tau \to \infty 的极限, 蒸馏中为什么用 τ>1\tau > 1?
3
白板推导 Softmax + 交叉熵的梯度 Lzi=piyi\frac{\partial L}{\partial z_i} = p_i - y_i, 并说明它是二分类 LR 的推广。
4
OvR 的得分为什么不是概率? 如何校准 (Platt scaling / Isotonic), 校准与 AUC 有何区别?
5
类别互斥假设: Softmax 适合什么任务, 多标签任务为什么该用多个 Sigmoid? OvR/OvO/Softmax 何时选哪个?
更新于 2026-08-12
🎯
检验攻克程度:针对「多分类 OvR/OvO/Softmax」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点逻辑回归 Log-Odds下一个知识点SVM 最大间隔与对偶

🔗 更多 经典机器学习 知识点卡片

AdaBoost 算法手推Bagging 与随机森林HMM 参数学习 Baum-WelchGBDT 负梯度拟合