M3-034M3: Deep Learning FoundationsOptimizers & Second-Order MethodsHard
Mastery:

Optimizers & Second-Order Methods: 什么是二阶优化与自然梯度?为什么深度学习不用它们。

📐 Mathematical Definition
θ←θ−ηH−1g;natural grad: θ←θ−ηF−1g\theta\leftarrow\theta-\eta H^{-1}g;\qquad \text{natural grad}:\ \theta\leftarrow\theta-\eta F^{-1}g
⚡ Executive Summary
Core Concept: 二阶法用 Hessian(或其近似)预条件梯度;自然梯度用 Fisher 信息矩阵。精度高但每步成本 O(n²)~O(n³),深度网络不可行。

📌 Key Takeaways

  • •
    牛顿法收敛二阶、但需 O(n³) 求逆与 O(n²) 存储
  • •
    自然梯度是在分布流形上的最速下降(KL 度量)
  • •
    K-FAC/Shampoo 用 Kronecker/分块近似降到可接受成本

📐 Mathematical Derivations

数学机理:<strong>牛顿法</strong>用二阶泰勒近似 f(θ+δ)≈f+f'ᵀδ+½δᵀHδ,最小化得 δ=−H⁻¹g;H 编码了各方向的曲率,故预条件后'一步到位'(二次函数一步收敛)。<strong>自然梯度</strong>来自信息几何:参数 θ 定义了分布 p(x|θ),参数空间上的'距离'不应是欧氏距离而应是两个分布的差异(KL 散度);KL 的二阶近似给出度量张量 F=𝔼[∇log p·∇log pᵀ](Fisher 信息矩阵),于是最速下降方向为 −F⁻¹g。关键联系:对负对数似然损失,<strong>Fisher 矩阵等于 Hessian 的期望</strong>(F=𝔼[H]),故自然梯度与牛顿法在该损失下一致,但 Fisher 始终半正定(Hessian 可能非正定),数值上更稳。<strong>代价</strong>:H 与 F 都是 n×n(n 为参数量);求逆 O(n³)、存储 O(n²);对 n=10⁹ 的模型完全不可行。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>为什么 K-FAC 可行</strong>——Kronecker-Factored Approximate Curvature 假设每层的 Fisher 块可分解为 A⊗B(输入协方差 ⊗ 输出梯度协方差),求逆从 O(n³) 降到 O(d³)(d 为层内维度);但仍需维护每层的协方差矩阵、且对 Transformer 的假设不总成立。② <strong>Shampoo 的复兴</strong>——Shampoo 对每层的梯度矩阵做左右预条件(L^{-1/4}GR^{-1/4}),在 TPU 大模型训练中显示出比 Adam 更快的收敛(Distributed Shampoo 已被用于部分工业训练);代价是额外的预条件子矩阵与求逆(用特征分解更新)。③ <strong>对角近似谱系</strong>——Adam 是 Fisher 的<strong>对角近似</strong>(只保留每个参数自己的二阶矩),这是它在'近似质量'与'成本'间的位置;Adafactor 进一步用低秩近似省显存。④ <strong>为什么理论优雅但不流行</strong>——(a) 随机梯度使 Hessian 估计噪声大、(b) 深层网络 Hessian 病态且含负特征值、(c) 每步成本远超'多走几步 SGD'的收益、(d) 分布式实现复杂(预条件子需跨设备同步)。⑤ <strong>实践结论</strong>——工业上'接近二阶'的收益主要通过 (a) 更好的优化器(Lion/Shampoo)、(b) 归一化层(隐式预条件)、(c) 学习率调度 获得,而非真用二阶法。⑥ <strong>面试要点</strong>——若被问'如何设计一个准二阶优化器',答:用对角(Adam)或块对角(K-FAC)或低秩近似,并强调'成本-收益权衡'是核心。
⚠️ Common Interview Pitfalls
  • ✕
    认为自然梯度与牛顿法完全等价(仅在特定损失下 Fisher=𝔼[H])
  • ✕
    忽略 Hessian 非正定导致的牛顿法不稳定问题
🎯 Interviewer Follow-ups
  • ?
    自然梯度为什么等价于 Fisher 矩阵预条件?
  • ?
    K-FAC 如何近似 Fisher 矩阵?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM3-033: Optimizers & Second-Order Methods: 比较 SGD+Momentum 与 Adam 的泛化差异。📋Back to BankNext →M3-035: Optimizers & Second-Order Methods: Adam 的偏差修正(bias correction)为什么必要?