返回 MLE 工程师 思维导图
中文·English
💻 MLE 工程师ID: mle-learning-rate-schedule-warmup

学习率 Warmup 与退火调优排障

LR Warmup & Cosine Annealing Tuning
🎯核心定义
学习率预热与余弦退火动态调度体系 (Learning Rate Warmup & Cosine Annealing Dynamic Scheduling) 是大模型与深层神经网络训练中控制参数更新步长演进、保证初期训练稳定与后期极限收敛的核心调度策略;核心由两个阶段组成:1) 线性预热阶段 (Linear Warmup: 在训练最初的 NwarmupN_{\text{warmup}} 步内,将学习率从 0 线性增加至最大学习率 ηmax\eta_{\max},防止初始随机权重在未稳定的自适应二阶动量 vtv_t 引导下迈出过大步长导致权重崩溃);2) 余弦退火衰减阶段 (Cosine Annealing Decay: 随后按照余弦半周期曲线平滑衰减至极小的基准学习率 ηt=ηmin+12(ηmaxηmin)(1+cos(tNwarmupTtotalNwarmupπ))\eta_t = \eta_{\min} + \frac{1}{2}(\eta_{\max} - \eta_{\min})\left(1 + \cos\left(\frac{t - N_{\text{warmup}}}{T_{\text{total}} - N_{\text{warmup}}} \pi\right)\right),使参数平稳沉降在损失平面的平坦宽广极小值点)。
💡使用场景
LLM 预训练与大模型 SFT 微调、视觉 Transformer 训练、学习率发散排障与调优。
解决的核心痛点
训练初期若直接使用大基础学习率会引发激活值剧烈震荡甚至直接产生 NaN 崩盘;固定学习率或阶梯衰减容易陷入局部尖锐极小值;Warmup 与 Cosine 调度保证了初期的绝对平稳与终局的卓越泛化。
🎯5 个高频面试考点 (Exam Points)
1
推导 Cosine Annealing 学习率更新公式,并解释为什么余弦衰减在训练中后期的平滑过渡比阶梯衰减 (Step Decay) 更有利于寻找平坦极小值 (Flat Minima)?
2
为什么在大模型使用 AdamW 优化器时,Linear Warmup 是绝对不可或缺的(解释二阶矩 vtv_t 刚开始时的方差未校准风险)?
3
线性缩放法则 (Linear Scaling Rule: 当 Batch Size 扩大 kk 倍时,学习率应扩大 kk 倍,即 η=kη0\eta = k \cdot \eta_0) 的理论依据与失效边界?
4
1Cycle 学习率调度策略 (One-Cycle Policy: 学习率上升的同时动量下降) 在快速收敛 (Super-Convergence) 中的应用机制?
5
持续预训练 (Continual Pre-training) 中的学习率重热 (Learning Rate Rewarming) 与学习率下限 ηmin\eta_{\min}(通常取 ηmax\eta_{\max}10%10\%)的设计?
🔗核心前置底层技术卡片 (点击穿透复习)
更新于 2026-08-14
🎯
检验攻克程度:针对「学习率 Warmup 与退火调优排障」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点不平衡 PR-AUC 与截断点标定下一个知识点分布式训练通信瓶颈与 DDP 调优

🔗 更多 MLE 工程师 知识点卡片

偏差-方差权衡与过拟合诊断常见损失函数选型与梯度特性优化器收敛性与动量选型准则模型集成 Stacking 与 Blending