M1-024M1: Mathematics & Statistics FundamentalsCalculus & Taylor ExpansionMedium
Mastery:

Calculus & Taylor Expansion: 解释拉格朗日乘子法,说明它如何把约束优化转为无约束。

📐 Mathematical Definition
L(x,λ)=f(x)+λg(x),∇f+λ∇g=0\mathcal L(x,\lambda)=f(x)+\lambda g(x),\qquad \nabla f+\lambda\nabla g=0
⚡ Executive Summary
Core Concept: 把约束乘上 λ 加入目标;最优解处目标梯度与约束梯度共线。

📌 Key Takeaways

  • •
    等式约束用拉格朗日;不等式约束用 KKT
  • •
    λ 的经济含义是'约束的影子价格'

📐 Mathematical Derivations

拉格朗日乘子法的几何直觉:在约束曲面 g(x)=0 上移动时,若目标 f 的梯度 ∇f 与约束的梯度 ∇g <strong>不平行</strong>,则 ∇f 必有一个沿约束曲面的切向分量,说明还能沿该方向继续下降 f——故极值点处必须有 ∇f=−λ∇g,即两者共线。构造拉格朗日函数 L(x,λ)=f(x)+λg(x) 后,对其求无约束驻点(∂L/∂x=0 给出 ∇f+λ∇g=0,∂L/∂λ=0 给出 g(x)=0)即同时满足最优性与可行性。多个等式约束时用向量乘子:L=f+Σᵢλᵢgᵢ,最优性条件为 ∇f=−Σᵢλᵢ∇gᵢ,即 ∇f 落在约束梯度的张成空间中。

🏭 Production Trade-offs

工程含义:① <strong>λ 是影子价格</strong>——λ* 表示'若把约束放松一个单位,最优值能改善多少'(∂f*/∂c=λ*),这在资源分配、预算约束、SVM 的对偶中都有直接解释:SVM 中 λᵢ>0 的样本正是<strong>支持向量</strong>,λᵢ=0 的样本不影响决策边界(KKT 互补松弛);② <strong>对偶问题</strong>——拉格朗日函数关于 x 取最小、关于 λ 取最大,得到对偶问题,其最优值给出原问题的下界(弱对偶),凸问题下相等(强对偶,Slater 条件保证),对偶常把难解的原问题转为更易解的形式(SVM 的对偶形式使核技巧成为可能);③ <strong>与正则化的联系</strong>——带约束的 min f s.t. ‖w‖≤c 等价于无约束的 min f+λ‖w‖(正则化),λ 与 c 一一对应,这就是为什么'正则化'与'约束'是同一件事的两种视角。
⚠️ Common Interview Pitfalls
  • ✕
    认为 λ 必须为正(等式约束的 λ 可正可负,不等式约束才要求 λ≥0)
  • ✕
    混淆拉格朗日(等式约束)与 KKT(含不等式约束)
🎯 Interviewer Follow-ups
  • ?
    多个约束怎么办?
  • ?
    λ 为负意味着什么?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM1-023: Calculus & Taylor Expansion: 什么是雅可比矩阵与向量-雅可比积(VJP)?为什么框架都用 VJP。📋Back to BankNext →M1-025: Calculus & Taylor Expansion: 解释二阶充分条件与鞍点,以及深度学习为何不怕鞍点。