TalentMe
How To
🗺️
AI Industry Map
NEW
Knowledge ▾
Intro & Usage
Machine Learning Repo
Data Science Repo
Resources ▾
Intro & Usage
AI Tech Vault (Tech Wiki)
Industry News
Tech Blogs
Research Papers
Open Source Projects
Tools Hub ▾
🛠️ Tools & Skills Overview
🌐 Interactive Web Tools
🗺️ AI Industry & Career Map
🧭 AI Career Transition Navigator & Roadmap
📚 AI Multi-Module Practice Hub
🎯 AI Skill Assessment
🧠 AI Skills Library
AI Skills & Prompts Overview
Local Agent Guide
Cloud Skills Templates
⚡ MCP Tools Suite
TalentMe MCP Guide
CLI Tools & Commands
Services ▾
🚀 Services & Plans Suite
🧭 1v1 Coaching & Services
💎 Plans & Pricing
💬 Contact & Consultation
Contact Us
💬 Discord
🌐
中
☀️
🔑
Login / Register
☰
技术知识库
›
复习路线图
›
数理基础 思维导图
›
Jacobian 与 Hessian
← 返回 数理基础 思维导图
中文
·
English
📐 数理基础
ID:
jacobian-hessian
Jacobian 与 Hessian
Jacobian & Hessian
🎯
核心定义
对
f
:
R
n
→
R
m
f: \mathbb{R}^n \to \mathbb{R}^m
f
:
R
n
→
R
m
, Jacobian 是
m
×
n
m \times n
m
×
n
矩阵
J
J
J
, 分量
J
i
j
=
∂
f
i
/
∂
x
j
J_{ij} = \partial f_i / \partial x_j
J
ij
=
∂
f
i
/
∂
x
j
— 每行是分量函数
f
i
f_i
f
i
的梯度行向量; 维度检查法则: 输入
n
n
n
维、输出
m
m
m
维 ⟹ Jacobian 形状
m
×
n
m \times n
m
×
n
(不是
n
×
m
n \times m
n
×
m
); 标量函数 (
m
=
1
m=1
m
=
1
) 的 Jacobian 是其梯度
∇
f
\nabla f
∇
f
的转置。它给出
f
f
f
的一阶线性近似
f
(
x
+
δ
)
≈
f
(
x
)
+
J
(
x
)
δ
f(x + \delta) \approx f(x) + J(x)\delta
f
(
x
+
δ
)
≈
f
(
x
)
+
J
(
x
)
δ
。二次型
f
(
x
)
=
x
T
A
x
f(x) = x^TAx
f
(
x
)
=
x
T
A
x
的梯度为
∇
f
=
(
A
+
A
T
)
x
\nabla f = (A + A^T)x
∇
f
=
(
A
+
A
T
)
x
,
A
A
A
对称时
∇
f
=
2
A
x
\nabla f = 2Ax
∇
f
=
2
A
x
。Hessian: 标量函数
f
:
R
n
→
R
f: \mathbb{R}^n \to \mathbb{R}
f
:
R
n
→
R
的二阶偏导矩阵
H
i
j
=
∂
2
f
/
∂
x
i
∂
x
j
∈
R
n
×
n
H_{ij} = \partial^2 f / \partial x_i \partial x_j \in \mathbb{R}^{n \times n}
H
ij
=
∂
2
f
/
∂
x
i
∂
x
j
∈
R
n
×
n
(对称); 凸性判定:
f
f
f
二阶连续可微时,
f
f
f
凸当且仅当
H
(
x
)
H(x)
H
(
x
)
对所有
x
x
x
半正定 (
H
⪰
0
H \succeq 0
H
⪰
0
), 严格凸当且仅当正定 (
H
≻
0
H \succ 0
H
≻
0
)。链式法则: 对
h
=
g
∘
f
h = g \circ f
h
=
g
∘
f
,
J
h
=
J
g
⋅
J
f
J_h = J_g \cdot J_f
J
h
=
J
g
⋅
J
f
, 维度相乘
(
p
×
m
)
(
m
×
n
)
=
p
×
n
(p \times m)(m \times n) = p \times n
(
p
×
m
)
(
m
×
n
)
=
p
×
n
可作一致性校验。
💡
使用场景
反向传播手推梯度时的维度核对; 牛顿法
x
t
+
1
=
x
t
−
H
−
1
∇
f
x_{t+1} = x_t - H^{-1}\nabla f
x
t
+
1
=
x
t
−
H
−
1
∇
f
(二阶曲率); 凸性分析 (KL 散度、交叉熵、二次损失); 二阶优化、Fisher 信息矩阵、拉普拉斯近似。
⚡
解决的核心痛点
矩阵求导手推的最大错误来源是转置与维度——"Jacobian 恒为
m
×
n
m \times n
m
×
n
"与链式法则的形状相乘可作为推导唯一性校验; Hessian 正定性给出判定凸函数的操作化标准: 凸 ⟹ 局部最优 = 全局最优, 机器学习损失可解性的根本判据; 牛顿法用曲率
H
−
1
H^{-1}
H
−
1
对病态问题 (条件数大) 一步收敛, 而一阶法需要沿等高线反复走。
🎯
5 个高频面试考点 (Exam Points)
1
维度检查: 为什么
f
:
R
n
→
R
m
f: \mathbb{R}^n \to \mathbb{R}^m
f
:
R
n
→
R
m
的 Jacobian 是
m
×
n
m \times n
m
×
n
而非
n
×
m
n \times m
n
×
m
? 手写
f
(
x
,
y
)
=
(
x
2
+
y
,
x
y
)
f(x,y) = (x^2 + y, xy)
f
(
x
,
y
)
=
(
x
2
+
y
,
x
y
)
的 Jacobian?
2
推导: 二次型
f
(
x
)
=
x
T
A
x
f(x) = x^TAx
f
(
x
)
=
x
T
A
x
的梯度
(
A
+
A
T
)
x
(A + A^T)x
(
A
+
A
T
)
x
与 Hessian
A
+
A
T
A + A^T
A
+
A
T
;
A
A
A
对称时为何简化为
2
A
x
2Ax
2
A
x
?
3
手算: 对
f
(
x
1
,
x
2
)
=
x
1
2
+
3
x
1
x
2
+
2
x
2
2
f(x_1, x_2) = x_1^2 + 3x_1x_2 + 2x_2^2
f
(
x
1
,
x
2
)
=
x
1
2
+
3
x
1
x
2
+
2
x
2
2
求 Jacobian/Hessian, 用主元判据 (
a
>
0
a > 0
a
>
0
且
a
c
−
b
2
>
0
ac - b^2 > 0
a
c
−
b
2
>
0
) 或特征值判断凸性?
4
证明: 二阶可微
f
f
f
凸当且仅当 Hessian 处处半正定; 为什么这对全局最优性至关重要 (凸 ⟹ 局部 = 全局)?
5
链式法则维度核对: 标量损失
L
=
∥
X
w
−
y
∥
2
L = \Vert Xw - y \Vert^2
L
=
∥
X
w
−
y
∥
2
对
w
w
w
的梯度, 用维度法则确认答案是
2
X
T
(
X
w
−
y
)
2X^T(Xw - y)
2
X
T
(
X
w
−
y
)
而非其他转置组合?
📖 关联深度指南:
📄 linear-algebra-for-ai →
更新于 2026-08-12
🎯
检验攻克程度:针对「Jacobian 与 Hessian」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题 ➔
← 上一个知识点
矩阵分解应用
下一个知识点 →
概率公理与贝叶斯定理
🔗 更多 数理基础 知识点卡片
Adam/AdamW 偏差修正推导
贝叶斯推断
偏差方差分解
Bootstrap