M2-017M2: Classical Machine LearningBias-Variance Tradeoff & Model SelectionEasy
Mastery:
Bias-Variance Tradeoff & Model Selection: 如何用学习曲线诊断高偏差与高方差?
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 训练与验证误差都高且接近 → 高偏差;训练低、验证高且差距大 → 高方差。
📌 Key Takeaways
- •高偏差:加特征/更复杂模型/减小正则
- •高方差:加数据/加正则/降复杂度
📐 Mathematical Derivations
学习曲线有两种画法:<strong>随训练集大小</strong>(固定模型)与<strong>随模型复杂度</strong>(固定数据)。诊断规则:① <strong>高偏差</strong>——训练误差本身很高(接近不可约噪声),且随数据量增加趋于平台(不下降),验证误差也高且与训练误差接近。这说明模型族<strong>无法表达</strong>真函数,加数据无用。② <strong>高方差</strong>——训练误差很低,验证误差明显更高,两者差距大;随数据量增加,验证误差持续下降且逐渐逼近训练误差。这说明模型对训练数据过度敏感。③ <strong>两者的组合</strong>——实践中常同时存在(如大模型 + 小数据),需分别处理。
🏭 Production Trade-offs
对应的处方:<strong>高偏差</strong> → 增加模型容量(更多层/更多特征)、加入有用特征(特征工程)、减少正则化、训练更久、换更强的模型族;<strong>高方差</strong> → 增加数据、加强正则(L1/L2/dropout/早停)、降低模型复杂度、集成(Bagging/模型平均)、特征选择。<strong>关键判断</strong>:加数据对高偏差无帮助(因为偏差由模型族决定),对高方差有帮助(方差 ∝ 1/n)——这是'先看是偏差还是方差问题再决定投入'的实践依据。诊断陷阱:① 若验证集与训练集<strong>分布不同</strong>(不是同分布随机划分),差距会被误判为高方差,故需先检查数据划分与泄漏;② 小数据集的学习曲线噪声大,应多次重复取平均;③ 训练误差本身受正则与早停影响,需在'无早停'条件下测才能反映真实偏差。
⚠️ Common Interview Pitfalls
- ✕把分布偏移误判为高方差
- ✕对高偏差问题一味加数据
🎯 Interviewer Follow-ups
- ?加更多数据对高偏差有帮助吗?
- ?为什么加数据主要降方差?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.