M2-020M2: Classical Machine LearningBias-Variance Tradeoff & Model SelectionHard
Mastery:

Bias-Variance Tradeoff & Model Selection: 解释双重下降(double descent)现象。

📐 Mathematical Definition
test err: ↓ ↑ ↓ as capacity↑\text{test err}:\ \downarrow\ \uparrow\ \downarrow\ \text{as capacity}\uparrow
⚡ Executive Summary
Core Concept: 模型复杂度超过插值阈值后,测试误差先升后降;与经典 U 型曲线不同。

📌 Key Takeaways

  • •
    过参数化模型仍能泛化(隐式正则 + 早停 + SGD 噪声)
  • •
    样本量也有双重下降(样本数增加误差先升后降)

📐 Mathematical Derivations

经典 U 型曲线(偏差-方差权衡)预测:模型复杂度超过最优点后测试误差单调上升。但 Belkin et al. (2019) 等发现<strong>实际存在第二段下降</strong>:当模型容量增加到'刚好能插值训练数据'(参数数 ≈ 样本数)时,测试误差达到<strong>峰值</strong>('插值峰值');继续增加容量至<strong>过参数化</strong>(参数 ≫ 样本)后,测试误差<strong>再次下降</strong>,甚至低于经典最优点。三段结构为:欠参数化区(经典 U 型下降段)→ 临界区(插值峰值,误差最高)→ 过参数化区(再次下降)。这一现象在神经网络、随机森林、k-NN 中都被观察到,且<strong>样本量维度</strong>也有对偶版本(样本数增加时误差先升后降)。

🏭 Production Trade-offs

理论解释与启示:① <strong>隐式正则</strong>——过参数化模型中,梯度下降/随机梯度下降会收敛到<strong>最小范数解</strong>(linear models 有严格定理:最小范数最小二乘解),这本身构成强正则;SGD 的噪声、早停、有限步数都进一步偏向平坦极小。② <strong>多重插值解</strong>——过参数化时存在无穷多能插值训练数据的解,优化算法(SGD)偏向选择'简单'的(范数小、曲率平)解,这些解泛化好。③ <strong>对实践的启示</strong>——(a) 传统'按参数数量选模型'的准则在过参数化区失效,大模型不必因'参数多于样本'而恐惧;(b) 早停与正则仍是必要的(它们控制落在哪个解);(c) 临界区最危险,故在小数据上训练大模型反而可能比中等模型更稳(只要正则得当);(d) 样本量维度提醒我们:增加数据在临界点附近可能<strong>暂时变差</strong>,需用学习曲线确认长期趋势而非短期波动。
⚠️ Common Interview Pitfalls
  • ✕
    认为过参数化必然过拟合(双重下降表明不一定)
  • ✕
    用参数数量作为模型选择的唯一准则
🎯 Interviewer Follow-ups
  • ?
    隐式正则来自哪些因素?
  • ?
    双重下降对模型选择有什么启示?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM2-019: Bias-Variance Tradeoff & Model Selection: 解释嵌套交叉验证,它解决了什么问题。📋Back to BankNext →M2-021: Bias-Variance Tradeoff & Model Selection: 什么是模型选择中的'选择性偏差'?如何避免。