返回 强化学习 思维导图
中文·English
🎮 强化学习ID: mdp-bellman

MDP 与 Bellman 方程

MDP & Bellman Equations
🎯核心定义
MDP (马尔可夫决策过程, Markov Decision Process) 是序列决策问题的数学模型,由五元组 (S,A,P,R,γ)(S, A, P, R, \gamma) 定义:SS 状态集、AA 动作集、P(ss,a)P(s'|s,a) 状态转移概率、R(s,a)R(s,a) 立即奖励、γ[0,1)\gamma \in [0,1) 折扣因子。Bellman 最优方程刻画最优值函数的自洽性 (最优子结构): V(s)=maxa[r(s,a)+γsP(ss,a)V(s)]V^*(s) = \max_a \left[ r(s,a) + \gamma \sum_{s'} P(s'|s,a) V^*(s') \right],其中 r(s,a)r(s,a) 是立即奖励, maxa\max_a 在所有动作中取最优, sP(ss,a)V(s)\sum_{s'} P(s'|s,a) V^*(s') 是按转移概率加权的后继状态期望值, γ\gamma 对未来收益折现。对应的 Q 版本: Q(s,a)=r(s,a)+γsP(ss,a)maxaQ(s,a)Q^*(s,a) = r(s,a) + \gamma \sum_{s'} P(s'|s,a) \max_{a'} Q^*(s',a'), 其中 maxaQ(s,a)\max_{a'} Q^*(s',a') 是下一状态的最优期望值;两者通过 V(s)=maxaQ(s,a)V^*(s) = \max_a Q^*(s,a) 互换。
💡使用场景
一切强化学习问题的建模起点——机器人控制、游戏 AI、推荐系统、以及 LLM 推理强化 (RLVR) 都把决策写成 MDP;面试必问五元组、γ\gamma 的作用、Bellman 方程的推导与 V/Q 两种形式。
解决的核心痛点
把带长期后果的序贯决策形式化为可计算的动态规划问题——Bellman 方程把"全局最优"拆成"当前动作 + 最优子结构",使 VV^* 成为压缩算子 TT 的不动点 V=TVV^* = TV^*, 从而可被 VI/PI/TD/Q-learning 等迭代算法逼近, 是所有 RL 算法共享的理论基石。
🎯5 个高频面试考点 (Exam Points)
1
写出 MDP 五元组并逐项解释?折扣因子 γ 的作用是什么?
2
手推并完整写出 Bellman 最优方程的 V* 与 Q* 形式,逐项解释每个符号的含义?
3
V* 与 Q* 的关系?为什么说 Bellman 方程体现了"最优子结构"?
4
Bellman 期望方程与最优方程的区别?给定策略 π 的 Vπ 如何定义?
5
为什么 γ < 1 能保证值函数有界且迭代收敛?γ = 1 或 γ = 0 时各有什么问题?
📖 关联深度指南:📄 foundations-and-deep-rl
更新于 2026-08-12
🎯
检验攻克程度:针对「MDP 与 Bellman 方程」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
下一个知识点价值迭代 vs 策略迭代

🔗 更多 强化学习 知识点卡片

Actor-Critic 框架行为克隆 BC上下文老虎机思维链与推理强化