M2-021M2: Classical Machine LearningBias-Variance Tradeoff & Model SelectionHard
Mastery:
Bias-Variance Tradeoff & Model Selection: 什么是模型选择中的'选择性偏差'?如何避免。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 在大量模型/超参中挑验证集最好的,会高估真实性能;需用独立测试集或嵌套 CV。
📌 Key Takeaways
- •搜索空间越大偏差越大
- •缓解:独立测试集、嵌套 CV、重复 CV
📐 Mathematical Derivations
偏差的来源:设对 m 个候选模型各得到验证误差估计 ε̂ᵢ,每个都是真值 εᵢ 加上噪声(方差 σ²)。取最小 ε̂_min 时,即使所有模型真性能相同(εᵢ=ε),ε̂_min 的期望也约为 ε−σ·√(2 log m)——即<strong>噪声的极小值</strong>。因此报告的'最优性能'系统性优于真实性能,且偏差随搜索空间 m 增大而增大(∝√(log m))。这就是<strong>选择偏差 / 多重比较偏差</strong>在模型选择中的体现。极端例子:Kaggle 排行榜的'排行榜过拟合'——团队在公共 LB 上反复提交、根据 LB 调参,最终公共 LB 分数与私有 LB 分数出现显著差距。
🏭 Production Trade-offs
避免与缓解手段:① <strong>独立测试集</strong>——把数据分为训练/验证/测试三部分,前两者用于开发(含调参、选模型),测试集<strong>只在最后用一次</strong>;这是最干净的方案,代价是测试集不能参与开发。② <strong>嵌套 CV</strong>——用外层 CV 提供无偏的性能估计,内层 CV 做选择(见上题)。③ <strong>重复 CV</strong>——多次重复 K 折取平均,降低估计方差从而减轻选择偏差。④ <strong>减少搜索空间</strong>——基于先验或文献缩小候选范围(而不是无脑网格搜索);或使用<strong>正则化的选择准则</strong>(如 AIC/BIC 对参数个数惩罚、1SE 规则)。⑤ <strong>统计比较而非挑最优</strong>——用配对检验比较候选(考虑方差),只在差异显著时才选更优者;若所有候选在统计上不可区分,选最简单的。⑥ <strong>预注册</strong>——在看见测试结果前确定评估协议与主指标,防止事后调整。
⚠️ Common Interview Pitfalls
- ✕在验证集上反复调参后把该分数当作泛化性能
- ✕只报最优模型的单点分数而不报置信区间
🎯 Interviewer Follow-ups
- ?如何量化这种偏差?
- ?为什么 Kaggle 排行榜会过拟合?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.