M2-088M2: Classical Machine LearningEvaluation Metrics & Hyperparameter TuningMedium
Mastery:
Evaluation Metrics & Hyperparameter Tuning: 什么是超参的重要度排序?如何高效调参。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 用 fANOVA/消融估计各超参对性能的贡献,优先调重要超参(学习率、正则、深度)。
📌 Key Takeaways
- •学习率通常最重要
- •分阶段调参(先粗后细)
📐 Mathematical Derivations
重要度估计方法:① <strong>fANOVA(函数方差分析)</strong>——把性能的方差分解到各超参(及其交互),得到每个超参解释的方差比例;这是 Optuna、SMAC 等工具内置的分析。② <strong>基于随机森林/GBM 的重要度</strong>——用已评估的配置训练一个模型预测性能,用其重要度近似超参重要度(简单有效)。③ <strong>单变量消融</strong>——固定其他超参,只变一个,观察性能变化(直观但忽略交互)。<strong>典型结论</strong>(跨任务的经验规律):<strong>学习率最重要</strong>(常解释 30–50% 的方差),其次是正则强度(weight decay/dropout)、模型容量(层数/宽度)、batch size、优化器参数。<strong>为什么学习率最重要</strong>——它直接决定优化的步长与收敛质量:过大导致发散/震荡,过小导致收敛慢或陷入差的局部解;且学习率与其他超参存在强交互(大 batch 需大学习率、强正则需更长训练)。
🏭 Production Trade-offs
高效调参策略:① <strong>按重要度排序调参</strong>——先调学习率(用 LR range test 或对数网格),再调正则强度,最后调容量与次要参数;这样能在有限预算内获得最大收益。② <strong>分阶段(粗到细)</strong>——第一阶段用随机搜索在大范围粗筛(找有希望的区域),第二阶段在局部精细搜索。③ <strong>早停与连续减半</strong>——用 Hyperband/ASHA 提前淘汰差配置(见上题)。④ <strong>迁移与热启动</strong>——相似任务/相似规模上的最优超参作为起点;或利用'超参迁移'(如 μP 参数化使小模型的最优学习率可迁移到大模型)。⑤ <strong>一次调一组相关参数</strong>——如'学习率 + batch size'、'学习率 + 调度'常需联合调(它们交互强)。⑥ <strong>减少搜索维度</strong>——用领域知识固定一些参数(如优化器选 AdamW、激活选 GELU),把预算集中在少数关键参数上。⑦ <strong>评估的稳定性</strong>——用 K 折或多次种子平均减少噪声;若评估噪声大于超参间的真实差异,调参就是拟合噪声。
⚠️ Common Interview Pitfalls
- ✕平均用力地调所有超参(忽略重要度差异)
- ✕在评估噪声大时依赖单次结果调参
🎯 Interviewer Follow-ups
- ?学习率为什么最重要?
- ?如何做超参的消融实验?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.