优化器收敛性与动量选型准则 (Optimizer Convergence Dynamics & Momentum Selection Rules) 是机器学习工程师针对不同网络架构(CV 卷积、NLP Transformer、稀疏推荐表)与训练规模,选择并调优一阶/自适应梯度优化器的决策体系;三大主流优化器流派:1) SGD with Momentum (带动量的随机梯度下降,结合 Nesterov 加速梯度 NAG,在计算机视觉与泛化要求极高的领域占据统治地位);2) AdamW (解耦权重衰减的自适应动量估计器:将 L2 正则化与一阶动量/二阶方差更新解耦
θt+1=θt−η(vt+ϵmt+λθt),是现代 Transformer、LLM 与多模态预训练的标准默认选择);3) AdaGrad / FTRL (针对稀疏特征频次自适应学习率,广泛用于大规模推荐搜广推 Embedding 更新)。