TalentMe
How To
🗺️
AI Industry Map
NEW
Knowledge ▾
Intro & Usage
Machine Learning Repo
Data Science Repo
Resources ▾
Intro & Usage
AI Tech Vault (Tech Wiki)
Industry News
Tech Blogs
Research Papers
Open Source Projects
Tools Hub ▾
🛠️ Tools & Skills Overview
🌐 Interactive Web Tools
🗺️ AI Industry & Career Map
🧭 AI Career Transition Navigator & Roadmap
📚 AI Multi-Module Practice Hub
🎯 AI Skill Assessment
🧠 AI Skills Library
AI Skills & Prompts Overview
Local Agent Guide
Cloud Skills Templates
⚡ MCP Tools Suite
TalentMe MCP Guide
CLI Tools & Commands
Services ▾
🚀 Services & Plans Suite
🧭 1v1 Coaching & Services
💎 Plans & Pricing
💬 Contact & Consultation
Contact Us
💬 Discord
🌐
中
☀️
🔑
Login / Register
☰
技术知识库
›
复习路线图
›
强化学习 思维导图
›
MDP 与 Bellman 方程
← 返回 强化学习 思维导图
中文
·
English
🎮 强化学习
ID:
mdp-bellman
MDP 与 Bellman 方程
MDP & Bellman Equations
🎯
核心定义
MDP (马尔可夫决策过程, Markov Decision Process) 是序列决策问题的数学模型,由五元组
(
S
,
A
,
P
,
R
,
γ
)
(S, A, P, R, \gamma)
(
S
,
A
,
P
,
R
,
γ
)
定义:
S
S
S
状态集、
A
A
A
动作集、
P
(
s
′
∣
s
,
a
)
P(s'|s,a)
P
(
s
′
∣
s
,
a
)
状态转移概率、
R
(
s
,
a
)
R(s,a)
R
(
s
,
a
)
立即奖励、
γ
∈
[
0
,
1
)
\gamma \in [0,1)
γ
∈
[
0
,
1
)
折扣因子。Bellman 最优方程刻画最优值函数的自洽性 (最优子结构):
V
∗
(
s
)
=
max
a
[
r
(
s
,
a
)
+
γ
∑
s
′
P
(
s
′
∣
s
,
a
)
V
∗
(
s
′
)
]
V^*(s) = \max_a \left[ r(s,a) + \gamma \sum_{s'} P(s'|s,a) V^*(s') \right]
V
∗
(
s
)
=
max
a
[
r
(
s
,
a
)
+
γ
∑
s
′
P
(
s
′
∣
s
,
a
)
V
∗
(
s
′
)
]
,其中
r
(
s
,
a
)
r(s,a)
r
(
s
,
a
)
是立即奖励,
max
a
\max_a
max
a
在所有动作中取最优,
∑
s
′
P
(
s
′
∣
s
,
a
)
V
∗
(
s
′
)
\sum_{s'} P(s'|s,a) V^*(s')
∑
s
′
P
(
s
′
∣
s
,
a
)
V
∗
(
s
′
)
是按转移概率加权的后继状态期望值,
γ
\gamma
γ
对未来收益折现。对应的 Q 版本:
Q
∗
(
s
,
a
)
=
r
(
s
,
a
)
+
γ
∑
s
′
P
(
s
′
∣
s
,
a
)
max
a
′
Q
∗
(
s
′
,
a
′
)
Q^*(s,a) = r(s,a) + \gamma \sum_{s'} P(s'|s,a) \max_{a'} Q^*(s',a')
Q
∗
(
s
,
a
)
=
r
(
s
,
a
)
+
γ
∑
s
′
P
(
s
′
∣
s
,
a
)
max
a
′
Q
∗
(
s
′
,
a
′
)
, 其中
max
a
′
Q
∗
(
s
′
,
a
′
)
\max_{a'} Q^*(s',a')
max
a
′
Q
∗
(
s
′
,
a
′
)
是下一状态的最优期望值;两者通过
V
∗
(
s
)
=
max
a
Q
∗
(
s
,
a
)
V^*(s) = \max_a Q^*(s,a)
V
∗
(
s
)
=
max
a
Q
∗
(
s
,
a
)
互换。
💡
使用场景
一切强化学习问题的建模起点——机器人控制、游戏 AI、推荐系统、以及 LLM 推理强化 (RLVR) 都把决策写成 MDP;面试必问五元组、
γ
\gamma
γ
的作用、Bellman 方程的推导与 V/Q 两种形式。
⚡
解决的核心痛点
把带长期后果的序贯决策形式化为可计算的动态规划问题——Bellman 方程把"全局最优"拆成"当前动作 + 最优子结构",使
V
∗
V^*
V
∗
成为压缩算子
T
T
T
的不动点
V
∗
=
T
V
∗
V^* = TV^*
V
∗
=
T
V
∗
, 从而可被 VI/PI/TD/Q-learning 等迭代算法逼近, 是所有 RL 算法共享的理论基石。
🎯
5 个高频面试考点 (Exam Points)
1
写出 MDP 五元组并逐项解释?折扣因子 γ 的作用是什么?
2
手推并完整写出 Bellman 最优方程的 V* 与 Q* 形式,逐项解释每个符号的含义?
3
V* 与 Q* 的关系?为什么说 Bellman 方程体现了"最优子结构"?
4
Bellman 期望方程与最优方程的区别?给定策略 π 的 Vπ 如何定义?
5
为什么 γ < 1 能保证值函数有界且迭代收敛?γ = 1 或 γ = 0 时各有什么问题?
📖 关联深度指南:
📄 foundations-and-deep-rl →
更新于 2026-08-12
🎯
检验攻克程度:针对「MDP 与 Bellman 方程」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题 ➔
下一个知识点 →
价值迭代 vs 策略迭代
🔗 更多 强化学习 知识点卡片
Actor-Critic 框架
行为克隆 BC
上下文老虎机
思维链与推理强化