一阶方法的收敛率被条件数支配(
κ 越大越慢),牛顿法用
H−1 对空间各向同性化,对病态问题一步收敛;代价是每步求解线性方程组
O(D3)、存储 Hessian 需
O(D2) 内存,高维深度网络不可行 → 实际用近似: L-BFGS(
O(D) 内存、历史梯度近似逆 Hessian)、Gauss-Newton(最小二乘中
H≈JTJ,用
JTJ+λI 保证可逆)。非凸函数 Hessian 可能非正定,牛顿方向不再是下降方向,需阻尼牛顿或加正则
H+λI(Levenberg-Marquardt)。