TalentMe
How To
🗺️
AI Industry Map
NEW
Knowledge ▾
Intro & Usage
Machine Learning Repo
Data Science Repo
Resources ▾
Intro & Usage
AI Tech Vault (Tech Wiki)
Industry News
Tech Blogs
Research Papers
Open Source Projects
Tools Hub ▾
🛠️ Tools & Skills Overview
🌐 Interactive Web Tools
🗺️ AI Industry & Career Map
🧭 AI Career Transition Navigator & Roadmap
📚 AI Multi-Module Practice Hub
🎯 AI Skill Assessment
🧠 AI Skills Library
AI Skills & Prompts Overview
Local Agent Guide
Cloud Skills Templates
⚡ MCP Tools Suite
TalentMe MCP Guide
CLI Tools & Commands
Services ▾
🚀 Services & Plans Suite
🧭 1v1 Coaching & Services
💎 Plans & Pricing
💬 Contact & Consultation
Contact Us
💬 Discord
🌐
中
☀️
🔑
Login / Register
☰
技术知识库
›
复习路线图
›
数理基础 思维导图
›
偏差方差分解
← 返回 数理基础 思维导图
中文
·
English
📐 数理基础
ID:
bias-variance
偏差方差分解
Bias-Variance Decomposition
🎯
核心定义
偏差-方差分解把测试均方误差拆成三项:
EGE
=
Bias
2
+
Var
+
σ
2
\text{EGE} = \text{Bias}^2 + \text{Var} + \sigma^2
EGE
=
Bias
2
+
Var
+
σ
2
。设真实关系
y
=
f
∗
(
x
)
+
ϵ
y = f^*(x) + \epsilon
y
=
f
∗
(
x
)
+
ϵ
,其中
E
[
ϵ
]
=
0
\mathbb{E}[\epsilon] = 0
E
[
ϵ
]
=
0
、
Var
(
ϵ
)
=
σ
2
\text{Var}(\epsilon) = \sigma^2
Var
(
ϵ
)
=
σ
2
且
ϵ
\epsilon
ϵ
与输入独立;模型
f
^
\hat f
f
^
在随机训练集
D
D
D
上拟合,定义
f
ˉ
(
x
)
=
E
D
[
f
^
(
x
)
]
\bar f(x) = \mathbb{E}_D[\hat f(x)]
f
ˉ
(
x
)
=
E
D
[
f
^
(
x
)]
。完整证明(对固定
x
x
x
): 先改写误差
y
−
f
^
=
(
f
∗
+
ϵ
)
−
f
^
=
ϵ
+
(
f
∗
−
f
^
)
y - \hat f = (f^* + \epsilon) - \hat f = \epsilon + (f^* - \hat f)
y
−
f
^
=
(
f
∗
+
ϵ
)
−
f
^
=
ϵ
+
(
f
∗
−
f
^
)
,展开平方:
E
[
(
y
−
f
^
)
2
]
=
E
[
ϵ
2
]
+
2
E
[
ϵ
(
f
∗
−
f
^
)
]
+
E
[
(
f
∗
−
f
^
)
2
]
\mathbb{E}[(y - \hat f)^2] = \mathbb{E}[\epsilon^2] + 2\mathbb{E}[\epsilon(f^* - \hat f)] + \mathbb{E}[(f^* - \hat f)^2]
E
[(
y
−
f
^
)
2
]
=
E
[
ϵ
2
]
+
2
E
[
ϵ
(
f
∗
−
f
^
)]
+
E
[(
f
∗
−
f
^
)
2
]
。交叉项消去:
ϵ
\epsilon
ϵ
独立于训练集
D
D
D
(从而独立于
f
^
\hat f
f
^
)且
E
[
ϵ
]
=
0
\mathbb{E}[\epsilon] = 0
E
[
ϵ
]
=
0
,故
2
E
[
ϵ
(
f
∗
−
f
^
)
]
=
2
E
[
ϵ
]
E
[
f
∗
−
f
^
]
=
0
2\mathbb{E}[\epsilon(f^* - \hat f)] = 2\mathbb{E}[\epsilon]\mathbb{E}[f^* - \hat f] = 0
2
E
[
ϵ
(
f
∗
−
f
^
)]
=
2
E
[
ϵ
]
E
[
f
∗
−
f
^
]
=
0
。第三项再展开: 在
f
∗
−
f
^
=
(
f
∗
−
f
ˉ
)
+
(
f
ˉ
−
f
^
)
f^* - \hat f = (f^* - \bar f) + (\bar f - \hat f)
f
∗
−
f
^
=
(
f
∗
−
f
ˉ
)
+
(
f
ˉ
−
f
^
)
上取
E
D
\mathbb{E}_D
E
D
,交叉项
2
(
f
∗
−
f
ˉ
)
E
D
[
f
ˉ
−
f
^
]
=
2
(
f
∗
−
f
ˉ
)
(
f
ˉ
−
f
ˉ
)
=
0
2(f^* - \bar f)\mathbb{E}_D[\bar f - \hat f] = 2(f^* - \bar f)(\bar f - \bar f) = 0
2
(
f
∗
−
f
ˉ
)
E
D
[
f
ˉ
−
f
^
]
=
2
(
f
∗
−
f
ˉ
)
(
f
ˉ
−
f
ˉ
)
=
0
,于是
E
D
[
(
f
∗
−
f
^
)
2
]
=
(
f
∗
−
f
ˉ
)
2
+
E
D
[
(
f
^
−
f
ˉ
)
2
]
=
Bias
2
+
Var
\mathbb{E}_D[(f^* - \hat f)^2] = (f^* - \bar f)^2 + \mathbb{E}_D[(\hat f - \bar f)^2] = \text{Bias}^2 + \text{Var}
E
D
[(
f
∗
−
f
^
)
2
]
=
(
f
∗
−
f
ˉ
)
2
+
E
D
[(
f
^
−
f
ˉ
)
2
]
=
Bias
2
+
Var
。合并三项得
EGE
=
Bias
2
+
Var
+
σ
2
\text{EGE} = \text{Bias}^2 + \text{Var} + \sigma^2
EGE
=
Bias
2
+
Var
+
σ
2
,其中
σ
2
\sigma^2
σ
2
为不可约噪声,任何模型都无法降低。
💡
使用场景
面试“为什么复杂模型过拟合/欠拟合”的标准框架: 模型越复杂,偏差越低(假设空间覆盖真实函数的能力强)、方差越高(对训练集的敏感度大);也用于解释 bagging(降方差)、boosting(降偏差)、正则化(增偏差降方差)。
⚡
解决的核心痛点
提供模型容量选择的定量诊断: 训练误差低而测试误差高 → 方差主导 → 加数据/正则化/bagging;训练测试都高 → 偏差主导 → 增加容量/特征。注意: 分解对每个固定
x
x
x
成立,一般再对输入分布取期望;对分类问题(0-1 损失)分解不成立,需用 Brier 分数等可分解的替代。
🎯
5 个高频面试考点 (Exam Points)
1
白板证明
E
[
(
y
−
f
^
)
2
]
=
Bias
2
+
Var
+
σ
2
\mathbb{E}[(y-\hat f)^2] = \text{Bias}^2 + \text{Var} + \sigma^2
E
[(
y
−
f
^
)
2
]
=
Bias
2
+
Var
+
σ
2
:写出展开、两次交叉项消去(
E
[
ϵ
]
=
0
\mathbb{E}[\epsilon] = 0
E
[
ϵ
]
=
0
与
E
D
[
f
^
]
=
f
ˉ
\mathbb{E}_D[\hat f] = \bar f
E
D
[
f
^
]
=
f
ˉ
)的每一步。
2
交叉项
2
E
[
ϵ
(
f
∗
−
f
^
)
]
2\mathbb{E}[\epsilon(f^* - \hat f)]
2
E
[
ϵ
(
f
∗
−
f
^
)]
为什么为 0?依赖哪些独立性/期望假设?噪声
σ
2
\sigma^2
σ
2
为什么不可约?
3
模型复杂度增大时 Bias 与 Var 各自如何变化?欠拟合与过拟合分别由哪一项主导?
4
用分解式解释: bagging 为什么主要降方差?boosting 为什么主要降偏差?
5
该分解对分类(0-1 损失)为什么不成立?可以用什么替代(Brier score)?
📖 关联深度指南:
📄 learning-paradigms-and-bias →
更新于 2026-08-12
🎯
检验攻克程度:针对「偏差方差分解」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题 ➔
← 上一个知识点
L1/L2 正则化几何
下一个知识点 →
Double Descent
🔗 更多 数理基础 知识点卡片
Adam/AdamW 偏差修正推导
贝叶斯推断
Bootstrap
因果推断与 Rubin 框架