返回 深度学习 思维导图
中文·English
🧠 深度学习ID: weight-decay

权重衰减与 AdamW

Weight Decay & AdamW
🎯核心定义
L2 正则化在损失中加入 λ2θ22\frac{\lambda}{2}\Vert\theta\Vert_2^2, 更新变为 θθη(L+λθ)\theta \leftarrow \theta - \eta(\nabla L + \lambda\theta); 对朴素 SGD, 它与权重衰减 θ(1ηλ)θηL\theta \leftarrow (1-\eta\lambda)\theta - \eta\nabla L 完全等价。但 Adam 中梯度项会被 v^+ϵ\sqrt{\hat{v}} + \epsilon 归一化, 使 λθ\lambda\theta 也被除以该因子, 有效衰减随梯度大小剧烈变化——L2 与权重衰减不再等价。AdamW 把权重衰减直接作用到参数上实现解耦: θθηλθηm^v^+ϵ\theta \leftarrow \theta - \eta\lambda\theta - \eta\frac{\hat{m}}{\sqrt{\hat{v}}+\epsilon}
💡使用场景
所有深度网络的泛化手段, Adam/AdamW 训练 (尤其大模型预训练/微调) 的标准配置; 面试常问 L2 与 weight decay 在 SGD 下的等价推导、Adam 下为什么不等价、AdamW 的改进。
解决的核心痛点
约束参数范数、防止过拟合。AdamW (Loshchilov & Hutter 2019) 修复了 Adam 中权重衰减被自适应学习率错误缩放的问题: 衰减系数固定且与梯度大小无关, 提升泛化 (论文报告 test 错误率下降约 2% 量级), 对学习率与 weight decay 超参更稳健; LLM 预训练 (如 LLaMA) 标准用 AdamW, weight decay 典型取 0.01~0.1 (比朴素 L2 的 5e-4 大一个量级)。
🎯5 个高频面试考点 (Exam Points)
1
推导 L2 正则化与 weight decay 在朴素 SGD 下的等价性: 写出 θθη(L+λθ)\theta \leftarrow \theta - \eta(\nabla L + \lambda\theta)θ(1ηλ)θηL\theta \leftarrow (1-\eta\lambda)\theta - \eta\nabla L 并说明等价条件?
2
为什么 Adam 下 L2 与 weight decay 不等价? λθ\lambda\theta 项被 v^+ϵ\sqrt{\hat{v}}+\epsilon 除会造成什么后果?
3
写出 AdamW 的解耦更新公式 θθηλθηm^v^+ϵ\theta \leftarrow \theta - \eta\lambda\theta - \eta\frac{\hat{m}}{\sqrt{\hat{v}}+\epsilon} 并解释为什么能提升泛化 (相对 Adam+L2)?
4
weight decay 的超参量级: AdamW 下典型取多少 (0.01~0.1)? 与 L2 常用的 5e-4 是什么关系?
5
weight decay 会把权重衰减到 0 吗? 为什么它主要约束范数而非清零参数?
更新于 2026-08-12
🎯
检验攻克程度:针对「权重衰减与 AdamW」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点Label Smoothing下一个知识点卷积与感受野

🔗 更多 深度学习 知识点卡片

激活函数演进Adam/AdamWAutograd 动态图BatchNorm 批归一化