M8-028M8: ML Systems, Engineering & ResearchTraining Platforms & Experiment TrackingMedium
Mastery:

Training Platforms & Experiment Tracking: 解释超参搜索平台的工程要点。

📐 Mathematical Definition
HPO: search space+algorithm+pruning+scheduling\text{HPO}:\ \text{search space}+\text{algorithm}+\text{pruning}+\text{scheduling}
⚡ Executive Summary
Core Concept: 搜索空间定义、搜索算法(网格/贝叶斯/ASHA)、早停(剪枝)、并行调度与结果管理。

📌 Key Takeaways

  • •
    搜索空间:连续/离散/条件超参;log 尺度
  • •
    算法:网格/随机/贝叶斯(TPE)/进化;早停(ASHA/Hyperband)
  • •
    调度:并行、抢占、优先级;结果管理(对比/可视化)

📐 Mathematical Derivations

数学机理:<strong>超参搜索(HPO)平台的要点</strong>——(1) <strong>搜索空间定义</strong>——(a) <strong>类型</strong>——连续(学习率)、离散(层数)、类别(优化器);(b) <strong>尺度</strong>——学习率/权重衰减用 <strong>log 尺度</strong>(因为跨越数量级);(c) <strong>条件超参</strong>——'若优化器是 Adam 则有 β₁'(条件空间);(d) <strong>约束</strong>(如'层数 × 宽度 < 上限')。(2) <strong>搜索算法</strong>——(a) <strong>网格搜索</strong>——穷举;<strong>缺点</strong>——维度灾难(指数增长);(b) <strong>随机搜索</strong>——随机采样;<strong>优点</strong>——(i) 简单;(ii) 在'只有少数超参重要'时<strong>优于网格</strong>(Bergstra & Bengio 2012);(c) <strong>贝叶斯优化</strong>——(i) 用'代理模型'(高斯过程/TPE)建模'超参 → 性能';(ii) 用'采集函数'(EI/UCB)平衡探索与利用;(iii) <strong>优点</strong>——样本效率高(用更少试验找到好配置);(iv) <strong>缺点</strong>——串行性(每次需等结果)、高维时退化;(d) <strong>进化算法</strong>(种群 + 变异);(e) <strong>多保真(multi-fidelity)</strong>——用'低保真'(少 epoch/小模型)快速筛选。(3) <strong>早停/剪枝(pruning)</strong>——(a) <strong>问题</strong>——很多配置'早期就很差',没必要跑完;(b) <strong>做法</strong>——(i) <strong>中位数停止(median stopping)</strong>——若中间指标差于'当前中位数'则停;(ii) <strong>ASHA(异步逐次减半)</strong>——把配置按'资源档位'(如 1/2/4/8 epoch)逐级筛选,差的在低档位被淘汰;<strong>优点</strong>——异步(不需等待)+ 高效;(iii) <strong>Hyperband</strong>——ASHA 的批同步版本;(iv) <strong>PBT(Population Based Training)</strong>——训练中'淘汰差的 + 变异好的'(持续进化);(c) <strong>效果</strong>——可节省数倍到数十倍算力。(4) <strong>并行调度</strong>——(a) <strong>并行度</strong>(同时跑多少试验);(b) <strong>抢占</strong>(高优先级试验抢占低优先级);(c) <strong>资源分配</strong>(每个试验的 GPU 数);(d) <strong>异步 vs 同步</strong>(贝叶斯常异步);(e) <strong>与集群调度的集成</strong>。(5) <strong>结果管理</strong>——(a) <strong>对比视图</strong>(平行坐标/散点图);(b) <strong>重要性与敏感性</strong>(哪些超参重要);(c) <strong>可复现</strong>(记录配置);(d) <strong>与实验管理集成</strong>。(6) <strong>成本控制</strong>——(a) <strong>多保真</strong>(小模型/少数据筛选);(b) <strong>早停</strong>;(c) <strong>迁移</strong>(用相似任务的'好超参'作为起点);(d) <strong>μP/μTransfer</strong>(在小模型上搜、迁移到大模型——<strong>最省成本</strong>)。<strong>与其他问题的关系</strong>——(a) 与'训练成本控制'(HPO 是成本大户);(b) 与'实验管理'(记录配置);(c) 与'μP'(超参迁移)。<strong>实践建议</strong>——(a) <strong>log 尺度</strong>(学习率类);(b) <strong>随机搜索做基线</strong>(简单有效);(c) <strong>贝叶斯/TPE 提升样本效率</strong>;(d) <strong>ASHA/Hyperband 早停</strong>(省算力);(e) <strong>多保真 + μTransfer</strong>(大模型场景);(f) <strong>记录与可视化</strong>。<strong>度量</strong>——(a) 找到最优配置的试验数;(b) 总算力成本;(c) 早停节省的比例;(d) 结果的可复现性。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>'随机搜索在少数超参重要时优于网格'</strong>——这是经典结论;面试中能指出是深度理解的标志。② <strong>'ASHA 异步早停'省数倍算力</strong>——且不需等待(异步)。③ <strong>'μTransfer 最省成本'</strong>——在小模型上搜超参、迁移到大模型;这是大模型时代的实用方案。④ <strong>'log 尺度'</strong>——学习率/权重衰减跨越数量级。⑤ <strong>'多保真'</strong>——用少 epoch/小模型快速筛选。⑥ <strong>面试要点</strong>——被问'超参怎么搜',应给出'<strong>搜索空间(log 尺度/条件)+ 算法(随机/贝叶斯)+ 早停(ASHA/Hyperband)+ 调度(并行/抢占)+ μTransfer</strong>';能指出'随机优于网格的条件'与'μTransfer'是深度理解的标志。
⚠️ Common Interview Pitfalls
  • ✕
    用网格搜索高维空间(维度灾难)
  • ✕
    不做早停(浪费大量算力)
🎯 Interviewer Follow-ups
  • ?
    为什么'贝叶斯优化'比随机搜索好?
  • ?
    ASHA 如何'早停'?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM8-027: Training Platforms & Experiment Tracking: 解释分布式训练的调度与容错。📋Back to BankNext →M8-029: Training Platforms & Experiment Tracking: 解释训练成本控制的手段。