返回 MLE 工程师 思维导图
中文·English
💻 MLE 工程师ID: mle-optimizer-convergence-rules

优化器收敛性与动量选型准则

Optimizer Convergence & Momentum
🎯核心定义
优化器收敛性与动量选型准则 (Optimizer Convergence Dynamics & Momentum Selection Rules) 是机器学习工程师针对不同网络架构(CV 卷积、NLP Transformer、稀疏推荐表)与训练规模,选择并调优一阶/自适应梯度优化器的决策体系;三大主流优化器流派:1) SGD with Momentum (带动量的随机梯度下降,结合 Nesterov 加速梯度 NAG,在计算机视觉与泛化要求极高的领域占据统治地位);2) AdamW (解耦权重衰减的自适应动量估计器:将 L2 正则化与一阶动量/二阶方差更新解耦 θt+1=θtη(mtvt+ϵ+λθt)\theta_{t+1} = \theta_t - \eta (\frac{m_t}{\sqrt{v_t} + \epsilon} + \lambda \theta_t),是现代 Transformer、LLM 与多模态预训练的标准默认选择);3) AdaGrad / FTRL (针对稀疏特征频次自适应学习率,广泛用于大规模推荐搜广推 Embedding 更新)。
💡使用场景
大模型预训练与微调、CV 骨干网络训练、超参数网格搜索与训练发散/震荡排障。
解决的核心痛点
早期 Adam 由于将 L2 正则简单等同于梯度惩罚,导致在自适应学习率缩放后高频特征的权重衰减被过度压缩,泛化性能显著逊于 SGD;AdamW 彻底修复了权重衰减数学公式,兼具自适应极速收敛与卓越泛化性。
🎯5 个高频面试考点 (Exam Points)
1
详细对比经典 Adam 与 AdamW 在权重衰减 (Weight Decay) 更新公式上的数学差异,解释为什么 Adam 的 L2 正则失效?
2
一阶动量 mt=β1mt1+(1β1)gtm_t = \beta_1 m_{t-1} + (1-\beta_1) g_t 与二阶动量 vt=β2vt1+(1β2)gt2v_t = \beta_2 v_{t-1} + (1-\beta_2) g_t^2 在训练初期的偏差校正 (Bias Correction) 推导?
3
为什么在卷积神经网络 (ResNet/ConvNeXt) 上 SGD+Momentum 的最终测试集泛化性能通常优于自适应类优化器?
4
Lion (EvoLved Sign Momentum) 优化器与 Adafactor (行/列低秩矩阵分解削减显存) 在大模型显存节约中的机制?
5
当损失震荡或出现梯度尖峰时,优化器超参数(β1=0.9,β2=0.95/0.98,ϵ=108106\beta_1=0.9, \beta_2=0.95/0.98, \epsilon=10^{-8}\sim 10^{-6})的避坑调优策略?
🔗核心前置底层技术卡片 (点击穿透复习)
📖 关联深度指南:📄 mle-core-cheatsheet
更新于 2026-08-14
🎯
检验攻克程度:针对「优化器收敛性与动量选型准则」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点常见损失函数选型与梯度特性下一个知识点模型集成 Stacking 与 Blending

🔗 更多 MLE 工程师 知识点卡片

偏差-方差权衡与过拟合诊断模型压缩、剪枝与量化基础手撕 Multi-Head Self-Attention手写 Softmax 防溢出与 Cross-Entropy