M3-046M3: Deep Learning FoundationsLearning Rate SchedulesHard
Mastery:

Learning Rate Schedules: 解释 One-Cycle / 循环学习率策略。

📐 Mathematical Definition
ηt=ηmin⁡+12(ηmax⁡−ηmin⁡)(1−cos⁡πtT) (one-cycle)\eta_t=\eta_{\min}+\tfrac12(\eta_{\max}-\eta_{\min})\left(1-\cos\frac{\pi t}{T}\right)\ (\text{one-cycle})
⚡ Executive Summary
Core Concept: 让 lr 在一个周期内先升后降(呈三角/余弦),配合动量反向变化;可大幅缩短训练时间并提升精度。

📌 Key Takeaways

  • •
    lr 先升后降,形成'超收敛'(super-convergence)
  • •
    动量与 lr 反向变化(lr 升时动量降)
  • •
    总步数固定、适合快速原型与固定预算训练

📐 Mathematical Derivations

数学机理:<strong>One-Cycle(Smith & Topin 2017)</strong> 的设计是:在单个训练周期内,lr 从较小值升到峰值(通常占前 30%~45% 的步数)、再降到接近 0(占剩余步数);同时<strong>动量反向变化</strong>(lr 上升时动量从 0.95 降到 0.85,lr 下降时升回 0.95)。其效果被称为 <strong>super-convergence</strong>:相比固定 lr 的训练,能在<strong>更少 epoch</strong> 下达到更高精度。机制解释有两条:(1) <strong>高 lr 阶段</strong>相当于对大范围参数空间的'探索',帮助跳出尖锐极小值、进入更平坦的区域(正则效果);(2) <strong>lr 下降阶段</strong>做精细收敛,且下降速率与动量配合使收敛稳定。<strong>循环学习率(CLR)</strong> 是更一般的框架:让 lr 在 [η_min, η_max] 间周期性三角/余弦变化,每个周期末的'重启'(warm restart)再次跳出局部区域,可提升泛化;SGDR(cosine annealing with warm restarts)即此思想,广泛用于 CV。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>适用场景</strong>——CLR/One-Cycle 最适合'固定训练预算 + 追求快速收敛'的场景(竞赛、原型、需要快速迭代的任务);对超大规模预训练(步数固定但极长、需随时续训)反而不如 WSD/cosine 实用。② <strong>与 cosine 的关系</strong>——One-Cycle 可视为'warmup + cosine decay'的推广(把 warmup 延长、峰值提高、末端降零);SGDR 则是多个 cosine 周期的拼接。③ <strong>超参敏感性</strong>——CLR 需设定 η_max(通常比固定 lr 的最优值大、甚至大一个量级)、周期长度、周期数;η_max 过大易发散,故仍需 range test 定界。④ <strong>理论解释的争议</strong>——super-convergence 的机制尚无统一理论;'高 lr 探索平坦解'是主流解释,但缺乏严格证明。⑤ <strong>与 batch size 的交互</strong>——高 lr 阶段需要足够大的 batch 抑制噪声;小 batch + 高 lr 会发散。⑥ <strong>面试要点</strong>——CLR 的加分回答是'能配合固定算力预算快速收敛,且高 lr 阶段有正则效果';同时应指出'不适合需长期续训的大模型预训练',体现权衡意识。
⚠️ Common Interview Pitfalls
  • ✕
    把 CLR 用于需随时续训的长程预训练(调度不可中断)
  • ✕
    η_max 设得过大导致早期发散
🎯 Interviewer Follow-ups
  • ?
    什么是 super-convergence?
  • ?
    循环学习率与重启(warm restart)的关系?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM3-045: Learning Rate Schedules: 解释 WSD(warmup-stable-decay)调度为什么适合大模型预训练。📋Back to BankNext →M3-047: Regularization & Training Tricks: 列举深度学习中主要的正则化手段。