M2-019M2: Classical Machine LearningBias-Variance Tradeoff & Model SelectionMedium
Mastery:

Bias-Variance Tradeoff & Model Selection: 解释嵌套交叉验证,它解决了什么问题。

📐 Mathematical Definition
outer:estimate;inner:tune\text{outer}: \text{estimate};\quad \text{inner}: \text{tune}
⚡ Executive Summary
Core Concept: 外层评估性能、内层调参;避免用同一份数据调参又评估造成的乐观偏差。

📌 Key Takeaways

  • •
    普通 CV 调参后再报同一 CV 分数是乐观偏差
  • •
    计算成本高,但报告更可信

📐 Mathematical Derivations

问题根源:若用同一份数据既选超参(或选模型)又报告性能,则报告的分数是'在众多候选中挑出的最优值',它系统性高于真实泛化性能——因为最优值包含了<strong>选择偏差</strong>(selection bias)。极端例子:在 100 个随机模型上做 CV 选最好,即使所有模型都无预测力,最优 CV 分数也会显著优于随机。嵌套 CV 的结构:<strong>外层</strong> K 折用于评估(每次留出一折作测试),在<strong>内层</strong>用外层的训练部分做 K' 折 CV 选超参,然后用选出的超参在外层训练集上重训、在外层测试集上评估。最终报告外层 K 个分数的均值与方差。

🏭 Production Trade-offs

实践要点:① <strong>何时必须用</strong>——比较多个模型族、调超参、做特征选择时(任何涉及'用数据做选择'的步骤);若超参是预先固定的(如文献推荐值),普通 CV 即可。② <strong>计算成本</strong>——K×K' 次训练(如 5×5=25 次),对深度模型昂贵;缓解手段:(a) 减少外层折数(如外层 5 折、内层 3 折);(b) 用<strong>部分数据</strong>做内层调参;(c) 用<strong>贝叶斯优化</strong>替代网格搜索减少内层评估次数;(d) 对大数据用'留出 + 单层 CV 调参'的折中(留出集足够大时偏差可忽略)。③ <strong>报告规范</strong>——应报告外层分数的均值与标准差(或置信区间),而非单点最优;若不同模型的置信区间重叠,不应声称显著更优。④ <strong>常见误用</strong>——把嵌套 CV 的结果当作'最终模型性能'去报告,但最终上线模型应在<strong>全部数据</strong>上重训(此时无测试集可评估),故嵌套 CV 的分数是'该建模流程的性能'而非'某次训练模型的性能'。
⚠️ Common Interview Pitfalls
  • ✕
    用同一份 CV 既调参又报告性能
  • ✕
    把嵌套 CV 分数当作最终上线模型的性能
🎯 Interviewer Follow-ups
  • ?
    什么时候必须用嵌套 CV?
  • ?
    如何降低其计算成本?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM2-018: Bias-Variance Tradeoff & Model Selection: 比较 K 折交叉验证、留一法(LOO)与留出法的取舍。📋Back to BankNext →M2-020: Bias-Variance Tradeoff & Model Selection: 解释双重下降(double descent)现象。