M2-020M2: Classical Machine LearningBias-Variance Tradeoff & Model SelectionHard
Mastery:
Bias-Variance Tradeoff & Model Selection: 解释双重下降(double descent)现象。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 模型复杂度超过插值阈值后,测试误差先升后降;与经典 U 型曲线不同。
📌 Key Takeaways
- •过参数化模型仍能泛化(隐式正则 + 早停 + SGD 噪声)
- •样本量也有双重下降(样本数增加误差先升后降)
📐 Mathematical Derivations
经典 U 型曲线(偏差-方差权衡)预测:模型复杂度超过最优点后测试误差单调上升。但 Belkin et al. (2019) 等发现<strong>实际存在第二段下降</strong>:当模型容量增加到'刚好能插值训练数据'(参数数 ≈ 样本数)时,测试误差达到<strong>峰值</strong>('插值峰值');继续增加容量至<strong>过参数化</strong>(参数 ≫ 样本)后,测试误差<strong>再次下降</strong>,甚至低于经典最优点。三段结构为:欠参数化区(经典 U 型下降段)→ 临界区(插值峰值,误差最高)→ 过参数化区(再次下降)。这一现象在神经网络、随机森林、k-NN 中都被观察到,且<strong>样本量维度</strong>也有对偶版本(样本数增加时误差先升后降)。
🏭 Production Trade-offs
理论解释与启示:① <strong>隐式正则</strong>——过参数化模型中,梯度下降/随机梯度下降会收敛到<strong>最小范数解</strong>(linear models 有严格定理:最小范数最小二乘解),这本身构成强正则;SGD 的噪声、早停、有限步数都进一步偏向平坦极小。② <strong>多重插值解</strong>——过参数化时存在无穷多能插值训练数据的解,优化算法(SGD)偏向选择'简单'的(范数小、曲率平)解,这些解泛化好。③ <strong>对实践的启示</strong>——(a) 传统'按参数数量选模型'的准则在过参数化区失效,大模型不必因'参数多于样本'而恐惧;(b) 早停与正则仍是必要的(它们控制落在哪个解);(c) 临界区最危险,故在小数据上训练大模型反而可能比中等模型更稳(只要正则得当);(d) 样本量维度提醒我们:增加数据在临界点附近可能<strong>暂时变差</strong>,需用学习曲线确认长期趋势而非短期波动。
⚠️ Common Interview Pitfalls
- ✕认为过参数化必然过拟合(双重下降表明不一定)
- ✕用参数数量作为模型选择的唯一准则
🎯 Interviewer Follow-ups
- ?隐式正则来自哪些因素?
- ?双重下降对模型选择有什么启示?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.