返回 强化学习 思维导图
中文·English
🎮 强化学习ID: model-vs-model-free

基于模型 vs 无模型 (MB vs MF)

Model-Based vs Model-Free
🎯核心定义
两大 RL 范式的对比:
📌核心概述
| 维度 | 基于模型 (Model-Based) | 无模型 (Model-Free) | | --- | --- | --- | | 样本效率 | 高(想象 rollout 复用数据) | 低(需海量真实交互) | | 模型偏差 | 有(学错的模型误导策略) | 无(直接从真实交互学习) | | 策略表达 | 规划即策略,可即席换目标 | 策略固定,换目标需重训 | | 计算开销 | 训练 + 每步规划开销大 | 推理便宜,上线开销小 | | 代表算法 | Dyna, MPC, MuZero, Dreamer | DQN, PPO, SAC, GRPO |
📌核心概述
核心风险—复合误差 (compounding error): 设模型与真实转移的每步误差 ε\varepsilon(如 TV 距离 DTV(Pϕ,P)εD_{\mathrm{TV}}(P_\phi, P^*) \le \varepsilon),则模型 rollout HH 步后的累积误差为 O(H2ε)O(H^2 \varepsilon)。直觉推导:第 kk 步引入的误差 ε\varepsilon 会沿后续价值更新被放大 O(Hk)O(H-k) 倍,对 kk 求和: k=1Hε(Hk)=εH(H1)2=O(H2ε)\sum_{k=1}^{H} \varepsilon (H-k) = \varepsilon \cdot \frac{H(H-1)}{2} = O(H^2 \varepsilon)——步数越长,误差二次方增长。
💡使用场景
面试必考对比题(样本效率 vs 模型偏差);算法选型:交互免费/数据充足选 MF(稳定、简单),交互昂贵或目标可复用选 MB;离线 RL 中常把两者结合(模型生成数据 + 保守 Q 约束)。
解决的核心痛点
两者互补——MF 无偏但样本贵,MB 高效但有模型偏差;混合路线(Dyna 式回放、MBPO 把模型 rollout 混入 buffer、离线 RL 用模型扩充数据集)取长补短。
🎯5 个高频面试考点 (Exam Points)
1
基于模型与无模型在样本效率、模型偏差、计算开销上的核心差异?
2
推导复合误差 O(H²ε):给出直觉与求和过程。
3
什么时候选基于模型,什么时候选无模型?(交互成本、目标可变性、数据规模)
4
如何混合两者缓解各自缺点?(Dyna、MBPO、离线 RL 的具体做法)
5
模型偏差如何量化/检测?规划时如何对模型不确定性保持鲁棒?
📖 关联深度指南:📄 model-based-rl-and-planning
更新于 2026-08-12
🎯
检验攻克程度:针对「基于模型 vs 无模型 (MB vs MF)」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点Dreamer RSSM 潜想象下一个知识点具身智能与机器人

🔗 更多 强化学习 知识点卡片

Actor-Critic 框架行为克隆 BC上下文老虎机思维链与推理强化