训练几乎所有 ML/DL 模型的基石算法,面试常对比批量梯度下降(BGD)、随机梯度下降(SGD)与 Mini-batch。SGD 每次随机抽一个样本估计梯度
gt=∇Lit(wt),由
E[gt]=n1∑i=1n∇Li(wt)=∇L(wt) 可知它是全局梯度的无偏估计;Mini-batch(大小
B)把方差降到原来的
1/B(独立同分布样本时
Var[g^]=Var[g]/B),但引入了“噪声球”: 强凸条件下 SGD 停在
∥w−w∗∥2≤2μησ2 的邻域内(
σ2 为梯度估计方差),误差不会精确到 0。