M2-087M2: Classical Machine LearningEvaluation Metrics & Hyperparameter TuningMedium
Mastery:

Evaluation Metrics & Hyperparameter Tuning: 比较网格搜索、随机搜索与贝叶斯优化。

📐 Mathematical Definition
BO: max⁡ EI(x)=E[max⁡(0,f(x)−f∗)]\text{BO}:\ \max\ \mathrm{EI}(x)=\mathbb E[\max(0,f(x)-f^*)]
⚡ Executive Summary
Core Concept: 网格穷举但指数爆炸;随机搜索在高维更高效;贝叶斯优化用代理模型指导采样。

📌 Key Takeaways

  • •
    随机搜索在低有效维度下接近最优
  • •
    Hyperband/ASHA 用早停加速

📐 Mathematical Derivations

三种方法的对比:① <strong>网格搜索</strong>——在每个超参的离散网格上穷举。缺点:<strong>维度诅咒</strong>——p 个超参各取 k 个值需 k^p 次评估(p=5、k=5 时 3125 次);且若某些超参不重要,网格在它们上面的取值组合浪费了大量评估。② <strong>随机搜索</strong>(Bergstra & Bengio 2012)——在超参空间随机采样。<strong>关键洞察</strong>:若只有少数超参真正重要('低有效维度'),随机搜索在相同预算下能覆盖更重要超参的更多取值——因为网格在重要维度上的取值数被不重要维度'摊薄'。理论上随机搜索优于网格搜索,且实现简单、天然可并行。③ <strong>贝叶斯优化</strong>——用<strong>代理模型</strong>(高斯过程或 TPE)建模'超参→性能'的函数,用<strong>采集函数</strong>(如 EI:期望改进)选择下一个评估点,平衡探索(不确定性高的区域)与利用(当前最优附近)。优点:在评估昂贵时(如训练大模型)样本效率最高;缺点:实现复杂、难以并行(每次选择依赖前次结果)、对高维(>20 维)效果下降。

🏭 Production Trade-offs

实践要点与选择:① <strong>优先随机搜索</strong>——简单、可并行、在多数场景与贝叶斯优化接近;是默认起点。② <strong>贝叶斯优化的适用</strong>——单次评估昂贵(数小时到数天)、维度较低(<20)、串行可接受时;常用工具 Optuna(TPE)、Ax/BoTorch(GP)。③ <strong>早停加速</strong>——<strong>Hyperband</strong> 用'连续减半'(successive halving):先用小预算评估大量配置,淘汰差的,对好的加大预算;<strong>ASHA</strong> 是异步版本(无需等待全部完成,适合并行)。这类方法利用'差的配置在小预算下就能看出'的性质,比纯搜索快数倍。④ <strong>参数空间的设定</strong>——学习率等参数应在<strong>对数尺度</strong>上搜索(数量级差异比线性差异更重要);并设置合理范围(过宽浪费预算)。⑤ <strong>并行与异步</strong>——网格/随机天然并行;贝叶斯优化需特殊处理(如批量采集函数、异步 BO);Hyperband/ASHA 天然适合异步并行。⑥ <strong>调参顺序</strong>——先调最重要的超参(学习率、正则强度、模型容量),再调次要的;可先粗后细(多阶段)。⑦ <strong>随机种子的影响</strong>——小数据/小模型上方差大,需多次种子重复评估,否则调参会被噪声主导。
⚠️ Common Interview Pitfalls
  • ✕
    在低维空间用网格搜索(随机搜索更高效)
  • ✕
    在线性尺度上搜索学习率(应对数尺度)
🎯 Interviewer Follow-ups
  • ?
    为什么随机搜索优于网格搜索?
  • ?
    Hyperband 的核心思想?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM2-086: Evaluation Metrics & Hyperparameter Tuning: 列举分类、回归、排序的常用评估指标。📋Back to BankNext →M2-088: Evaluation Metrics & Hyperparameter Tuning: 什么是超参的重要度排序?如何高效调参。