M3-048M3: Deep Learning FoundationsRegularization & Training TricksEasy
Mastery:
Regularization & Training Tricks: 解释权重衰减为什么常与学习率解耦。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: L2 加在梯度里会被自适应 lr 缩放扭曲;解耦衰减直接在参数上乘 (1−ηλ),衰减率恒定可控(AdamW)。
📌 Key Takeaways
- •L2 正则会进入 Adam 的 m/v 统计
- •解耦后衰减量 ∝ θ,与梯度尺度无关
- •改 lr 会改变实际正则强度(ηλ 耦合)
📐 Mathematical Derivations
数学机理:在 <strong>SGD</strong> 下,把 L2 加进 loss(g=∇f+λθ)与直接在参数上衰减(θ←θ(1−ηλ)−η∇f)<strong>是等价的</strong>:两者都给出 θ←θ−η∇f−ηλθ。故在 SGD 时代,'weight decay'与'L2 正则'可互换。但进入 <strong>Adam</strong> 后两者分道扬镳:L2 的 λθ 项进入 m、v 的 EWMA 统计,再被 √v̂ 归一化,导致<strong>衰减强度依赖于该参数的梯度历史</strong>——梯度大的参数衰减被削弱、梯度小的被加强。<strong>解耦衰减</strong>把 λθ 从梯度中取出,直接做 θ←θ(1−ηλ),衰减量严格正比于 θ、与梯度无关,因而可控且可解释。有效正则强度为 <strong>ηλ</strong>:这是'每步收缩比例',故改 lr 必须同步改 λ 才能保持正则不变。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>为什么'解耦'是更正确的</strong>——正则化的语义是'对参数施加先验',应独立于优化器的自适应机制;把正则混入梯度等于让优化器的设计(对角预条件)意外地调制了正则强度,违反模块化原则。② <strong>λ 的量级</strong>——AdamW 在 LLM 中常用 λ=0.1(配合 lr 1e-4~3e-4),对应每步收缩 1e-5~3e-5,累积数千步后是显著的收缩。③ <strong>与 μP 的关系</strong>——μP 理论给出 λ 应随模型宽度反向缩放(宽度越大 λ 越小),以保证'每层有效衰减'与规模无关;这是 λ 可迁移性的理论基础。④ <strong>稀疏场景的例外</strong>——对 embedding 等稀疏更新的参数,L2 会同时衰减未被触发的行(浪费),而 decoupled decay 同样会衰减所有参数;更精细的做法是对不同参数组设不同 λ(如 bias/norm 参数不衰减)。⑤ <strong>实践配置</strong>——标准做法是 <strong>对权重矩阵衰减、对 bias 与 LayerNorm 的 γ/β 不衰减</strong>;这在 GPT/LLaMA 的实现中均可见。⑥ <strong>面试延伸</strong>——被问'为什么 Adam 时代才强调解耦',答'SGD 下两者数学等价,Adam 的自适应归一化破坏了等价性'——这是区分记忆与理解的经典问题。
⚠️ Common Interview Pitfalls
- ✕改 lr 不同步改 λ(有效正则强度漂移)
- ✕对所有参数(含 bias/norm)统一衰减(通常有害)
🎯 Interviewer Follow-ups
- ?为什么 λ 与 lr 的乘积才是有效正则强度?
- ?SGD 下 L2 与 decoupled decay 是否等价?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.