M3-045M3: Deep Learning FoundationsLearning Rate SchedulesMedium
Mastery:
Learning Rate Schedules: 解释 WSD(warmup-stable-decay)调度为什么适合大模型预训练。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: warmup 升温、stable 段恒定高 lr 长期探索、decay 段快速退火;stable 段可随时中断续训,decay 决定最终质量。
📌 Key Takeaways
- •decay 段通常只占总步数的 10%~20%,却决定最终 loss
- •stable 段可保存 checkpoint 后随时继续,无需预知总步数
- •支持多轮'预训练→继续预训练→退火'的拼接流程
📐 Mathematical Derivations
数学机理:WSD 的理论基础来自'学习率与损失面探索'的研究(Hägele 等、以及 μP 系列的工作)。核心观察:<strong>高 lr 下模型持续处于'探索状态'</strong>——损失维持在一个较高的'平台'上,但模型在该平台上不断探索参数空间的不同区域;<strong>衰减段的作用是把参数从探索状态'精炼'到收敛状态</strong>——lr 快速下降时,参数被吸引到附近的一个极小值并精细收敛。关键发现是:只要在稳定平台上<strong>充分探索</strong>,最终的衰减段<strong>可以很短</strong>(10%~20% 步数)就能达到与全程 cosine 相当甚至更好的最终 loss。这解释了为什么'stable 段长 + decay 段短'的组合是高效的。此外,从<strong>参数轨迹</strong>看,decay 段的低 lr 相当于对 stable 段末期的多个'候选解'做了一次精炼选择。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>工程价值(最重要)</strong>——cosine 必须在训练前确定总步数 T,中途改 T 需重算曲线、且无法与已训练的 checkpoint 无缝衔接;WSD 的 stable 段可<strong>任意延长或截断</strong>,使'先训练一版、看效果、再决定继续训练'成为可能。这在算力预算不确定、需要多轮迭代的工业场景中极其关键。② <strong>与 cosine 的实测对比</strong>——多个报告显示 WSD 与 cosine 最终质量相当,且 WSD 的 stable checkpoint 更'通用'(可作为后续 SFT/继续预训练的更好起点,因为它未被过度退火)。③ <strong>多阶段训练</strong>——LLaMA-3 等采用'多轮 cosine/线性衰减'的拼接;WSD 的稳定段概念让'预训练 → 长上下文扩展 → 指令微调'的每段都有独立的 decay,避免早期退火锁定参数。④ <strong>decay 形状的选择</strong>——decay 段常用 linear 或 1−√ 形状(如 inverse sqrt);形状对最终 loss 有影响但不如'是否有 decay 段'重要。⑤ <strong>与 batch size 的联动</strong>——stable 段的高 lr 需配合足够大的 batch 以控制噪声;否则高 lr 下的噪声会主导。⑥ <strong>面试要点</strong>——若被问'你会怎么设计 100B token 的预训练调度',推荐 WSD 并给出理由(可续训 + 平台探索 + 短退火);这是体现工程判断力的高分回答。
⚠️ Common Interview Pitfalls
- ✕以为 WSD 的 stable 段越长越好(需与算力预算平衡)
- ✕忽略 decay 段形状与最终 lr 的取值
🎯 Interviewer Follow-ups
- ?为什么 decay 段短也能达到好效果?
- ?WSD 与 cosine 的最终质量对比如何?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.