M1-021M1: Mathematics & Statistics FundamentalsCalculus & Taylor ExpansionEasy
Mastery:

Calculus & Taylor Expansion: 写出泰勒展开,并说明梯度、海森矩阵在优化中的角色。

📐 Mathematical Definition
f(x+Δ)≈f(x)+∇f⊤Δ+12Δ⊤HΔf(x+\Delta)\approx f(x)+\nabla f^\top\Delta+\tfrac12\Delta^\top H\Delta
⚡ Executive Summary
Core Concept: 一阶项给梯度下降方向,二阶项(海森)描述曲率,决定步长与收敛速度。

📌 Key Takeaways

  • •
    牛顿法用 H⁻¹ 调整步长,二次收敛但代价 O(n³)
  • •
    深度学习用一阶法 + 自适应步长替代

📐 Mathematical Derivations

泰勒展开把任意光滑函数局部近似为多项式:一阶项 ∇fᵀΔ 给出最速下降方向,二阶项 ½ΔᵀHΔ 用曲率修正该方向。<strong>牛顿法</strong>令导数为零:∇f+HΔ=0 ⇒ Δ=−H⁻¹∇f,即在<strong>曲率大的方向走小步、曲率小的方向走大步</strong>,在二次函数上一步到最优,故有二次收敛(误差平方级下降)。梯度下降则等价于用 (1/η)I 近似 H⁻¹,忽略了各方向曲率差异——这就是为什么病态问题(条件数大)下梯度下降极慢:需要在陡峭方向用极小学习率以防震荡,导致平坦方向进展缓慢。

🏭 Production Trade-offs

工程权衡:① <strong>牛顿法代价 O(n³)</strong>(求逆)+ O(n²) 存储海森,对百万/十亿参数模型完全不可行;② <strong>准牛顿法</strong>(BFGS/L-BFGS)用历史梯度差近似 H⁻¹,降到 O(n²) 存储,适合中小规模凸问题(如逻辑回归);③ <strong>对角近似</strong>(Adam/RMSProp)只保留 H 的对角元(即每维梯度平方的滑动平均),代价 O(n),这正是 Adam 的本质——用逐参数自适应学习率近似二阶信息;④ <strong>K-FAC/Shampoo</strong> 用 Kronecker 结构或分块对角近似海森,在超大模型上开始复兴(Muon 优化器即源于此思路)。实践中还需注意:深度学习的损失非凸,海森可能不定,牛顿方向可能是上升方向,故需加阻尼(Levenberg-Marquardt)。
⚠️ Common Interview Pitfalls
  • ✕
    认为牛顿法总是更快(非凸/病态时可能失效)
  • ✕
    忽视海森存储与求逆的 O(n²)/O(n³) 代价
🎯 Interviewer Follow-ups
  • ?
    牛顿法为什么在大模型上不实用?
  • ?
    对角近似海森的方法有哪些?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM1-020: Linear Algebra: 解释正定性,以及它在优化与协方差矩阵中的意义。📋Back to BankNext →M1-022: Calculus & Taylor Expansion: 解释链式法则与反向传播的关系。