M2-103M2: Classical Machine LearningBias-Variance Tradeoff & Model SelectionMedium
Mastery:
Bias-Variance Tradeoff & Model Selection: 在什么情况下增加数据无法改善性能?
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 高偏差(模型族无法表达真函数)、噪声主导(不可约误差大)、分布偏移、标签质量差。
📌 Key Takeaways
- •偏差由模型族决定,与 n 无关
- •σ²(不可约噪声)无法通过任何手段降低
📐 Mathematical Derivations
四种情形:① <strong>高偏差</strong>——若模型族无法表达真实函数(如用线性模型拟合强非线性关系),偏差项与 n 无关,加数据只会让训练误差与验证误差都收敛到同一个<strong>偏高的平台</strong>(学习曲线的典型形态);此时应<strong>增加模型容量/特征</strong>而非数据。② <strong>不可约噪声 σ² 主导</strong>——若目标本身有随机性(如用户点击的固有随机性、标签噪声),σ² 构成性能下界;加数据只能降低方差项,无法突破 σ²。判断方法:若贝叶斯错误率(理论上限)接近当前性能,说明已接近下界。③ <strong>分布偏移</strong>——若训练分布与测试/线上分布不同,加<strong>同分布的</strong>训练数据无助于提升目标域性能(甚至可能因强化错误模式而有害);此时应做<strong>领域适应</strong>(重加权、微调、域不变表示)或采集目标域数据。④ <strong>标签质量差</strong>——若标签有系统性错误(如标注规则错误、泄漏导致的错标),加数据会放大错误模式;应优先<strong>清理标签</strong>。此外,<strong>数据冗余</strong>(重复样本)也导致加数据无增益。
🏭 Production Trade-offs
判断与对策:① <strong>学习曲线判断法</strong>——画学习曲线(性能 vs 训练集大小):若曲线已<strong>平台化</strong>(加数据无改善)→ 加数据无用;若仍在下降 → 加数据有帮助。这是最直接的判据。② <strong>训练/验证误差的关系</strong>——若训练误差本身就高(高偏差)→ 加数据无用;若训练误差低而验证误差高(高方差)→ 加数据有用。③ <strong>贝叶斯错误率估计</strong>——若同一输入有多个不同标签(或专家之间标注不一致),说明存在不可约噪声;可用<strong>标签一致性(Cohen's κ)</strong> 估计噪声水平。④ <strong>数据质量的优先级</strong>——实践中'清洗 10% 的错误标签'往往比'增加 10% 的数据'更有效;应先做<strong>数据审计</strong>(检查标签错误率、重复率、分布一致性)。⑤ <strong>分布偏移的诊断</strong>——用<strong>对抗验证</strong>(训练一个分类器区分训练集与目标集,若 AUC 显著 >0.5 则存在偏移)检测;发现偏移后应做重加权或采集目标域数据。⑥ <strong>投入决策</strong>——加数据的成本(采集/标注)通常远高于改模型;故应先确认'瓶颈是方差而非偏差'再投入数据。
⚠️ Common Interview Pitfalls
- ✕在高偏差模型上盲目增加数据
- ✕忽略分布偏移,用同分布数据试图提升目标域性能
🎯 Interviewer Follow-ups
- ?如何判断'加数据无帮助'?
- ?分布偏移下加数据会怎样?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.