M3-043M3: Deep Learning FoundationsLearning Rate SchedulesMedium
Mastery:

Learning Rate Schedules: 解释学习率预热的另一种动机:Adam 的二阶矩偏差。

📐 Mathematical Definition
E[vt]=(1−β2t)E[g2] ⇒ mtvt∝11−β2t\mathbb{E}[v_t]=(1-\beta_2^t)\mathbb{E}[g^2]\ \Rightarrow\ \frac{m_t}{\sqrt{v_t}}\propto\frac{1}{\sqrt{1-\beta_2^t}}
⚡ Executive Summary
Core Concept: Adam 的 v 是平方梯度的 EWMA,初期低估真实二阶矩,使有效步长偏大;warmup 等 v 收敛后再放大 lr。

📌 Key Takeaways

  • •
    β₂=0.999 时,前 1000 步 v 都显著低估
  • •
    偏差修正可修系统偏差,但不修 v 的估计方差
  • •
    warmup 与偏差修正互补,不互相替代

📐 Mathematical Derivations

数学机理:Adam 的更新为 η·m̂/√v̂。<strong>偏差修正</strong>处理了'v 系统性低估'的问题(除以 1−β₂^t)。但还有两个残留问题:<strong>(1) 估计方差</strong>——v_t 只由 t 个样本的梯度平方估计,其<strong>相对标准差</strong>约 ∝1/√(有效样本数),早期极大;即使期望被修正正确,单次估计仍可能偏小,导致该步的 η/√v̂ 偏大。<strong>(2) 有效样本数</strong>——EWMA 的有效记忆长度约 1/(1−β₂)=1000(β₂=0.999),故 v 需要约 1000 步才能'看满'一个周期;在此之前 v̂ 的波动大,放大 lr 会放大这种波动。warmup 的作用正是:在 v̂ 估计尚不可靠的早期,用较小的 lr 抑制'除以一个不准的分母'带来的风险;等 v̂ 稳定后(约 warmup 结束)再放开 lr。这也解释了为什么 <strong>β₂ 越大、warmup 越必要</strong>(记忆越长、收敛越慢)。定量地,GPT 系列把 β₂ 从 0.999 降到 0.95,有效记忆从 1000 步降到 20 步,warmup 需求也随之降低。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>偏差修正 vs warmup 的分工</strong>——偏差修正修的是<strong>期望偏差</strong>(确定性的、可解析修正),warmup 抑制的是<strong>估计方差</strong>(随机性的、无法解析消除);两者解决不同问题,故都需要。这是面试中区分'真正理解'与'背答案'的关键点。② <strong>β₂ 的选择依据</strong>——β₂ 大 → v 更平滑但对变化响应慢(适合梯度尺度稳定的场景);β₂ 小 → 响应快但噪声大。LLM 因梯度尺度随训练变化(尤其 warmup 期),选较小的 β₂。③ <strong>RAdam 的思路</strong>——RAdam 显式计算'v 的有效样本数'并用它调节自适应程度(在样本不足时退化为 SGD+Momentum),可自动实现 warmup 效果;这是'用理论替代启发式'的尝试。④ <strong>实践观察</strong>——去掉 warmup 但保留偏差修正,训练通常仍能在稍长步数后收敛,但早期可能出现 loss spike;说明 warmup 是'稳定性保险'而非'收敛必要条件'。⑤ <strong>与 β₁ 的交互</strong>——一阶动量 β₁=0.9(记忆 10 步)比 β₂ 收敛快得多,故早期 m 相对可靠、v 是瓶颈;这进一步支持'warmup 主要针对 v'的判断。⑥ <strong>面试延伸</strong>——被问'能不能只做偏差修正不做 warmup',答'理论上可行但实践风险高,因为偏差修正不消除 v 的方差'。
⚠️ Common Interview Pitfalls
  • ✕
    以为偏差修正可以替代 warmup(两者针对不同误差来源)
  • ✕
    忽略 β₂ 与 warmup 长度的耦合关系
🎯 Interviewer Follow-ups
  • ?
    为什么即使有偏差修正仍需要 warmup?
  • ?
    β₂ 越大,所需 warmup 越长吗?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM3-042: Learning Rate Schedules: 学习率与 batch size 的关系是什么?线性缩放规则。📋Back to BankNext →M3-044: Learning Rate Schedules: 如何诊断学习率是否合适?