相比 SGD+动量,Adam 用
m^t/v^t 对每个参数做自适应缩放(尺度约 1),对病态条件数(
κ 大)与稀疏梯度鲁棒,且偏差修正保证早期迭代不被低估的动量拖慢。AdamW 的 weight decay 与 L2 解耦: Adam+L2 中正则项
λwt 进入
gt 后被
v^t 缩放,有效衰减
ηλwt/v^t 随历史梯度幅度变化——大梯度方向被正则得太多、小梯度方向被正则得太少;AdamW 直接更新
wt+1=wt−η(λwt+v^t+ϵm^t),每个参数每步衰减率恒为
1−ηλ,训练更稳、泛化更好。