返回 强化学习 思维导图
中文·English
🎮 强化学习ID: monte-carlo-td

蒙特卡洛 vs 时序差分

MC vs TD Learning
🎯核心定义
蒙特卡洛 (MC) 用整条回合的实际回报更新, 回报定义为折扣累计奖励 Gt=k=0Tt1γkrt+k+1G_t = \sum_{k=0}^{T-t-1} \gamma^k r_{t+k+1}, 其中 TT 是回合终止时刻, rt+k+1r_{t+k+1}tt 之后第 k+1k+1 步的奖励, γk\gamma^k 是折现;更新规则 V(st)V(st)+α[GtV(st)]V(s_t) \leftarrow V(s_t) + \alpha\left[ G_t - V(s_t) \right]。由于 GtG_tvπ(st)v_\pi(s_t) 的无偏样本估计 (只依赖真实采样, 不依赖当前估计), MC 无偏;但它是 TtT-t 个随机奖励的累加和, 方差随回合长度和 γ\gamma 增大, 且必须等回合结束后才能学习, 只适用于回合制任务。
📌核心概述
时序差分 (TD) 用单步转移 + 当前估计自举 (bootstrap), 目标为 rt+1+γV(st+1)r_{t+1} + \gamma V(s_{t+1})——用 t+1t+1 步的真实奖励 rt+1r_{t+1} 加上对自己当前估计 V(st+1)V(s_{t+1}) 的折现;更新规则 V(st)V(st)+α[rt+1+γV(st+1)V(st)]V(s_t) \leftarrow V(s_t) + \alpha\left[ r_{t+1} + \gamma V(s_{t+1}) - V(s_t) \right], 括号内即 TD 误差。因为目标里含估计值, TD 有偏 (偏置朝当前估计方向), 但只依赖少量随机量、方差低, 每步都可学习, 也适用于持续性任务。MC 相当于 TD 误差跨整条轨迹累加 (λ=1\lambda = 1), DP 是 λ=0\lambda = 0 的完全自举——TD 是两者的中间体;表格型任务中 TD(0) 在收敛条件下最终收敛到真实 vπv_\pi
💡使用场景
无模型 (不已知 P,RP, R) 的在线学习——Q-learning/DQN/Actor-Critic 全部基于 TD 误差;MC 用于诊断性对比和回合式任务 (如每局才更新的棋盘评估)。面试高频考点是偏差-方差权衡。
解决的核心痛点
无模型环境无法用 DP 直接迭代, MC 又因高方差、延迟更新而不实用;TD 用自举把单步误差作为学习信号, 在偏差 (来自估计) 与方差 (来自随机性) 之间取折中, 兼顾样本效率、在线性与稳定性, 成为主流学习范式。
🎯5 个高频面试考点 (Exam Points)
1
写出 MC 回报 Gt 与 TD 目标的完整公式并逐项解释?两者的更新规则有何不同?
2
为什么说 MC 无偏高方差、TD 有偏低方差?偏差和方差各来自哪里?
3
TD 的"自举" (bootstrap) 指什么?与 MC 的主要区别?
4
TD(λ) 如何统一 MC 与 TD?λ 取 0 和 1 各退化成什么?
5
为什么 TD 是工业界主流?DQN/Q-learning 中 TD 误差如何参与更新?
📖 关联深度指南:📄 foundations-and-deep-rl
更新于 2026-08-12
🎯
检验攻克程度:针对「蒙特卡洛 vs 时序差分」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点价值迭代 vs 策略迭代下一个知识点Q-Learning 离策略

🔗 更多 强化学习 知识点卡片

Actor-Critic 框架行为克隆 BC上下文老虎机思维链与推理强化