TalentMe
How To
🗺️
AI Industry Map
NEW
Knowledge ▾
Intro & Usage
Machine Learning Repo
Data Science Repo
Resources ▾
Intro & Usage
AI Tech Vault (Tech Wiki)
Industry News
Tech Blogs
Research Papers
Open Source Projects
Tools Hub ▾
🛠️ Tools & Skills Overview
🌐 Interactive Web Tools
🗺️ AI Industry & Career Map
🧭 AI Career Transition Navigator & Roadmap
📚 AI Multi-Module Practice Hub
🎯 AI Skill Assessment
🧠 AI Skills Library
AI Skills & Prompts Overview
Local Agent Guide
Cloud Skills Templates
⚡ MCP Tools Suite
TalentMe MCP Guide
CLI Tools & Commands
Services ▾
🚀 Services & Plans Suite
🧭 1v1 Coaching & Services
💎 Plans & Pricing
💬 Contact & Consultation
Contact Us
💬 Discord
🌐
中
☀️
🔑
Login / Register
☰
技术知识库
›
复习路线图
›
经典机器学习 思维导图
›
多分类 OvR/OvO/Softmax
← 返回 经典机器学习 思维导图
中文
·
English
📊 经典机器学习
ID:
multiclass-strategies
多分类 OvR/OvO/Softmax
Multiclass Strategies: OvR/OvO/Softmax
🎯
核心定义
把二分类器扩展到
K
K
K
类有三种主流策略。OvR (一对余): 训练
K
K
K
个“该类 vs 其余”的分类器, 预测取得分最高者, 参数量
O
(
K
⋅
d
)
O(K \cdot d)
O
(
K
⋅
d
)
; OvO (一对一): 训练
(
K
2
)
=
K
(
K
−
1
)
2
\binom{K}{2} = \frac{K(K-1)}{2}
(
2
K
)
=
2
K
(
K
−
1
)
个两两分类器, 投票裁决, 单模型更简单但总成本
O
(
K
2
)
O(K^2)
O
(
K
2
)
; Softmax (直接多分类): 单个模型输出
K
K
K
维概率
p
i
=
e
z
i
/
τ
∑
j
=
1
K
e
z
j
/
τ
p_i = \frac{e^{z_i/\tau}}{\sum_{j=1}^{K} e^{z_j/\tau}}
p
i
=
∑
j
=
1
K
e
z
j
/
τ
e
z
i
/
τ
, 温度
τ
\tau
τ
控制平滑度——
τ
→
0
\tau \to 0
τ
→
0
退化为 argmax,
τ
→
∞
\tau \to \infty
τ
→
∞
趋于均匀分布; 配合交叉熵损失梯度仍为
p
−
y
p - y
p
−
y
(Softmax 是多分类的 Logistic)。
💡
使用场景
面试常考三者对比 (模型数/参数量/表达能力)、温度
τ
\tau
τ
在知识蒸馏与概率校准中的作用、OvR 得分为何不能当概率。
⚡
解决的核心痛点
OvR 每类只拿“自己 vs 其余”训练, 类别不平衡严重且
K
K
K
个分类器得分不可比 (需校准, 如 Platt scaling); OvO 在
K
K
K
大时模型数随
(
K
2
)
\binom{K}{2}
(
2
K
)
爆炸 (
K
=
100
K=100
K
=
100
要 4950 个模型), 且投票可能平票; Softmax 单模型端到端训练、天然输出合法概率, 但要求类别互斥 (非互斥任务用多个二分类)。温度
τ
\tau
τ
额外提供分布塑形能力: 蒸馏时
τ
>
1
\tau > 1
τ
>
1
软化标签传递暗知识, 推理用
τ
=
1
\tau = 1
τ
=
1
;
τ
\tau
τ
也影响预测置信度与校准质量。
🎯
5 个高频面试考点 (Exam Points)
1
OvR vs OvO 对比: 模型数量 (
K
K
K
vs
K
(
K
−
1
)
2
\frac{K(K-1)}{2}
2
K
(
K
−
1
)
)、训练/推理成本、投票平局问题,
K
=
100
K=100
K
=
100
时各需要多少个模型?
2
Softmax 温度
τ
\tau
τ
的作用: 推导
τ
→
0
\tau \to 0
τ
→
0
与
τ
→
∞
\tau \to \infty
τ
→
∞
的极限, 蒸馏中为什么用
τ
>
1
\tau > 1
τ
>
1
?
3
白板推导 Softmax + 交叉熵的梯度
∂
L
∂
z
i
=
p
i
−
y
i
\frac{\partial L}{\partial z_i} = p_i - y_i
∂
z
i
∂
L
=
p
i
−
y
i
, 并说明它是二分类 LR 的推广。
4
OvR 的得分为什么不是概率? 如何校准 (Platt scaling / Isotonic), 校准与 AUC 有何区别?
5
类别互斥假设: Softmax 适合什么任务, 多标签任务为什么该用多个 Sigmoid? OvR/OvO/Softmax 何时选哪个?
📖 关联深度指南:
📄 linear-and-logistic-regression →
更新于 2026-08-12
🎯
检验攻克程度:针对「多分类 OvR/OvO/Softmax」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题 ➔
← 上一个知识点
逻辑回归 Log-Odds
下一个知识点 →
SVM 最大间隔与对偶
🔗 更多 经典机器学习 知识点卡片
AdaBoost 算法手推
Bagging 与随机森林
HMM 参数学习 Baum-Welch
GBDT 负梯度拟合