M3-031M3: Deep Learning FoundationsOptimizers & Second-Order MethodsEasy
Mastery:

Optimizers & Second-Order Methods: Adam 与 AdamW 的区别是什么?为什么 AdamW 更正确。

📐 Mathematical Definition
Adam: g←∇f+λθ;AdamW: θ←θ(1−ηλ)−ηm^v^+ϵ\text{Adam}:\ g\leftarrow\nabla f+\lambda\theta;\qquad \text{AdamW}:\ \theta\leftarrow\theta(1-\eta\lambda)-\eta\frac{\hat m}{\sqrt{\hat v}+\epsilon}
⚡ Executive Summary
Core Concept: Adam 把 L2 正则混入梯度(等价于用自适应 lr 缩放的正则);AdamW 解耦权重衰减,直接在参数上乘衰减因子。

📌 Key Takeaways

  • •
    L2 正则加在 loss 上,会进入 m/v 的统计、被自适应缩放扭曲
  • •
    AdamW 的衰减与梯度正交,等效衰减率恒为 ηλ
  • •
    所有主流 LLM(GPT/LLaMA)都用 AdamW,λ 常取 0.1

📐 Mathematical Derivations

数学机理:设原损失 f(θ),<strong>L2 正则</strong>的做法是把 λθ 加到梯度里,即 g=∇f+λθ,再送入 Adam 的自适应归一化。问题在于:λθ 这一项被 √v̂ 除以后,<strong>大参数(v 大)的衰减被缩小、小参数(v 小)的衰减被放大</strong>——衰减强度依赖于该参数的梯度历史,这不是我们想要的'均匀收缩'。<strong>AdamW</strong> 把衰减从梯度中拿出来,直接在参数更新时乘 (1−ηλ):θ←θ(1−ηλ)−η·m̂/(√v̂+ε)。此时衰减量正比于 θ 本身(均匀按比例收缩),且与梯度统计<strong>完全解耦</strong>。数学上,AdamW 的隐式正则近似于 <strong>L2 的缩放版本</strong>但尺度恒定;Loshchilov & Hutter (2019) 证明解耦后 AdamW 在多个任务上显著优于 Adam+L2。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>等价条件</strong>——当所有参数的 v̂ 相同(如线性模型、或梯度尺度均匀)时,Adam 与 AdamW 的衰减行为趋于一致;差异在<strong>参数间梯度尺度差异大</strong>的网络(Transformer 正是如此)中才显著。② <strong>为什么 AdamW 效果更好</strong>——解耦后,权重衰减独立于学习率调度:即使 lr 被 warmup 到很小,衰减仍按 ηλ 正常进行(而非被 v̂ 扭曲);这使正则强度可控、可解释。③ <strong>λ 与 lr 的耦合</strong>——注意 AdamW 的衰减率是 ηλ,故<strong>改 lr 就改了实际正则强度</strong>;当从 1e-3 降到 1e-4 时,若想保持正则不变应把 λ 放大 10 倍。这是调参时最易忽视的耦合。④ <strong>LLM 实践</strong>——GPT-3/LLaMA 用 AdamW,λ=0.1、β=(0.9, 0.95)(注意 β₂ 从 0.999 降到 0.95,因为大 batch 下需要更快响应二阶矩变化)、ε=1e-8。⑤ <strong>μP 视角</strong>——在 μP 参数化下,lr 与 λ 的缩放规则进一步明确(衰减应随宽度反向缩放),这是 μP 能'零样本迁移超参'的关键之一。⑥ <strong>面试陷阱</strong>——常被追问'那 Adam 是不是错的',正确回答:Adam+L2 在数学上仍是一个合法的正则化方法,只是<strong>其有效正则强度不可控且与梯度尺度纠缠</strong>;AdamW 是更清晰、更易调参的版本,而非'Adam 有 bug'。
⚠️ Common Interview Pitfalls
  • ✕
    以为 AdamW 只是'换个写法'(两者正则行为本质不同)
  • ✕
    改 lr 时不相应调整 λ(实际正则强度随 ηλ 变化)
🎯 Interviewer Follow-ups
  • ?
    什么情况下 Adam 与 AdamW 等价?
  • ?
    为什么权重衰减要与 lr 解耦(即 ηλ 形式)?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM3-030: Optimizers & Second-Order Methods: 写出 SGD、Momentum、Adam 的更新式。📋Back to BankNext →M3-032: Optimizers & Second-Order Methods: 解释 Adam 的 ε 参数作用,以及它在大模型中的常见取值。