返回 强化学习 思维导图
中文·English
🎮 强化学习ID: mpc

MPC 规划 (Model Predictive Control)

Model Predictive Control (MPC)
🎯核心定义
MPC (Model Predictive Control, 模型预测控制) 用已知或学到的环境模型,在每一步决策时对长度为 HH 的有限时域做规划,最大化累计回报:J=k=0H1γkr(sk,ak)J = \sum_{k=0}^{H-1} \gamma^k \, r(s_k, a_k)其中 sk+1Pϕ(sk,ak)s_{k+1} \sim P_\phi(\cdot | s_k, a_k) 由模型前向推出。规划器从当前状态 s0s_0 搜索动作序列 (a0,,aH1)(a_0, \dots, a_{H-1}),但只执行第一个动作,下个时刻重新规划——滚动时域 (receding horizon),每步都把新观测拉回真实轨迹,抵抗模型误差与扰动。
📌核心概述
动作序列搜索: ① Random Shooting——从先验分布均匀采样 KK 条完整动作序列,按 JJ 评估取最优;简单但样本利用率低;② CEM (Cross-Entropy Method)——迭代改进:采样 KK 条 → 按 JJ 保留 top-ρ\rho 精英 → 用精英拟合高斯分布(更新均值/方差) → 再采样,迭代若干轮后用最优分布的中心动作开局,通常比 Random Shooting 用更少样本找到更好解。
💡使用场景
连续控制(机器人、自动驾驶、无人机)、有廉价仿真器/已知动力学模型的任务;MPC 不训练策略网络,"规划即策略",可即席换奖励目标。
解决的核心痛点
免去学策略所需的巨额采样,直接在线搜索最优动作;局限是受模型误差与有限时域 HH 影响,HH 太小只见局部、HH 太大误差累积,且每步规划的计算开销高。
🎯5 个高频面试考点 (Exam Points)
1
写出 MPC 的规划目标,并解释滚动时域 (receding horizon) 的含义与作用。
2
Random Shooting 与 CEM 分别如何搜索动作序列?CEM 的迭代流程?
3
MPC 相比学习策略函数(如 PPO/SAC 学出的 π)有哪些优缺点?
4
模型误差与有限时域 H 如何影响 MPC?H 取太小会怎样?
5
MPC 在机器人/自动驾驶中的典型用法?(轨迹优化 + 闭环重规划)
📖 关联深度指南:📄 model-based-rl-and-planning
更新于 2026-08-12
🎯
检验攻克程度:针对「MPC 规划 (Model Predictive Control)」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点Dyna 架构 (Dyna-Q)下一个知识点MuZero 潜空间模型

🔗 更多 强化学习 知识点卡片

Actor-Critic 框架行为克隆 BC上下文老虎机思维链与推理强化