📌核心概述
| 维度 | 基于模型 (Model-Based) | 无模型 (Model-Free) |
| --- | --- | --- |
| 样本效率 | 高(想象 rollout 复用数据) | 低(需海量真实交互) |
| 模型偏差 | 有(学错的模型误导策略) | 无(直接从真实交互学习) |
| 策略表达 | 规划即策略,可即席换目标 | 策略固定,换目标需重训 |
| 计算开销 | 训练 + 每步规划开销大 | 推理便宜,上线开销小 |
| 代表算法 | Dyna, MPC, MuZero, Dreamer | DQN, PPO, SAC, GRPO |