TalentMe
How To
🗺️
AI Industry Map
NEW
Knowledge ▾
Intro & Usage
Machine Learning Repo
Data Science Repo
Resources ▾
Intro & Usage
AI Tech Vault (Tech Wiki)
Industry News
Tech Blogs
Research Papers
Open Source Projects
Tools Hub ▾
🛠️ Tools & Skills Overview
🌐 Interactive Web Tools
🗺️ AI Industry & Career Map
🧭 AI Career Transition Navigator & Roadmap
📚 AI Multi-Module Practice Hub
🎯 AI Skill Assessment
🧠 AI Skills Library
AI Skills & Prompts Overview
Local Agent Guide
Cloud Skills Templates
⚡ MCP Tools Suite
TalentMe MCP Guide
CLI Tools & Commands
Services ▾
🚀 Services & Plans Suite
🧭 1v1 Coaching & Services
💎 Plans & Pricing
💬 Contact & Consultation
Contact Us
💬 Discord
🌐
中
☀️
🔑
Login / Register
☰
技术知识库
›
复习路线图
›
深度学习 思维导图
›
权重衰减与 AdamW
← 返回 深度学习 思维导图
中文
·
English
🧠 深度学习
ID:
weight-decay
权重衰减与 AdamW
Weight Decay & AdamW
🎯
核心定义
L2 正则化在损失中加入
λ
2
∥
θ
∥
2
2
\frac{\lambda}{2}\Vert\theta\Vert_2^2
2
λ
∥
θ
∥
2
2
, 更新变为
θ
←
θ
−
η
(
∇
L
+
λ
θ
)
\theta \leftarrow \theta - \eta(\nabla L + \lambda\theta)
θ
←
θ
−
η
(
∇
L
+
λ
θ
)
; 对朴素 SGD, 它与权重衰减
θ
←
(
1
−
η
λ
)
θ
−
η
∇
L
\theta \leftarrow (1-\eta\lambda)\theta - \eta\nabla L
θ
←
(
1
−
η
λ
)
θ
−
η
∇
L
完全等价。但 Adam 中梯度项会被
v
^
+
ϵ
\sqrt{\hat{v}} + \epsilon
v
^
+
ϵ
归一化, 使
λ
θ
\lambda\theta
λ
θ
也被除以该因子, 有效衰减随梯度大小剧烈变化——L2 与权重衰减不再等价。AdamW 把权重衰减直接作用到参数上实现解耦:
θ
←
θ
−
η
λ
θ
−
η
m
^
v
^
+
ϵ
\theta \leftarrow \theta - \eta\lambda\theta - \eta\frac{\hat{m}}{\sqrt{\hat{v}}+\epsilon}
θ
←
θ
−
η
λ
θ
−
η
v
^
+
ϵ
m
^
。
💡
使用场景
所有深度网络的泛化手段, Adam/AdamW 训练 (尤其大模型预训练/微调) 的标准配置; 面试常问 L2 与 weight decay 在 SGD 下的等价推导、Adam 下为什么不等价、AdamW 的改进。
⚡
解决的核心痛点
约束参数范数、防止过拟合。AdamW (Loshchilov & Hutter 2019) 修复了 Adam 中权重衰减被自适应学习率错误缩放的问题: 衰减系数固定且与梯度大小无关, 提升泛化 (论文报告 test 错误率下降约 2% 量级), 对学习率与 weight decay 超参更稳健; LLM 预训练 (如 LLaMA) 标准用 AdamW, weight decay 典型取 0.01~0.1 (比朴素 L2 的 5e-4 大一个量级)。
🎯
5 个高频面试考点 (Exam Points)
1
推导 L2 正则化与 weight decay 在朴素 SGD 下的等价性: 写出
θ
←
θ
−
η
(
∇
L
+
λ
θ
)
\theta \leftarrow \theta - \eta(\nabla L + \lambda\theta)
θ
←
θ
−
η
(
∇
L
+
λ
θ
)
与
θ
←
(
1
−
η
λ
)
θ
−
η
∇
L
\theta \leftarrow (1-\eta\lambda)\theta - \eta\nabla L
θ
←
(
1
−
η
λ
)
θ
−
η
∇
L
并说明等价条件?
2
为什么 Adam 下 L2 与 weight decay 不等价?
λ
θ
\lambda\theta
λ
θ
项被
v
^
+
ϵ
\sqrt{\hat{v}}+\epsilon
v
^
+
ϵ
除会造成什么后果?
3
写出 AdamW 的解耦更新公式
θ
←
θ
−
η
λ
θ
−
η
m
^
v
^
+
ϵ
\theta \leftarrow \theta - \eta\lambda\theta - \eta\frac{\hat{m}}{\sqrt{\hat{v}}+\epsilon}
θ
←
θ
−
η
λ
θ
−
η
v
^
+
ϵ
m
^
并解释为什么能提升泛化 (相对 Adam+L2)?
4
weight decay 的超参量级: AdamW 下典型取多少 (0.01~0.1)? 与 L2 常用的 5e-4 是什么关系?
5
weight decay 会把权重衰减到 0 吗? 为什么它主要约束范数而非清零参数?
📖 关联深度指南:
📄 normalization-and-regularization →
更新于 2026-08-12
🎯
检验攻克程度:针对「权重衰减与 AdamW」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题 ➔
← 上一个知识点
Label Smoothing
下一个知识点 →
卷积与感受野
🔗 更多 深度学习 知识点卡片
激活函数演进
Adam/AdamW
Autograd 动态图
BatchNorm 批归一化