深度学习过参数化优化动力学与无限宽极限下的神经正切核 (Neural Tangent Kernel, NTK / Jacot et al. 提出) 理论体系是将极其复杂的非凸深层神经网络梯度下降优化,严格等价映射为可解析求解的凸线性核回归 (Kernel Ridge Regression) 的里程碑级数学框架;核心定理:当全连接或卷积神经网络的隐藏层宽度
m→∞ 时,权重在梯度下降训练过程中的相对变化量趋于 0(即处于“懒惰训练 Lazy Training / 线性化微扰制度”),此时参数梯度内积所定义的经验 NTK 矩阵
Θ(x,x′)=⟨∇θf(x;θ),∇θf(x′;θ)⟩ 在整个训练全过程中保持
恒定不变,收敛至确定性的确定核函数
Θ∞(x,x′);在此极限下:1) 连续时间梯度流 (Gradient Flow) 具有严格的线性微分方程闭式解析解:
ft(x)=y−e−Θ∞ty;2) 证明了只要样本没有重合,极宽的深度神经网络以一阶梯度下降能够以指数速度
100% 全局收敛至 0 训练误差(彻底破解非凸优化局部极小陷阱)。