TalentMe
How To
🗺️
AI Industry Map
NEW
Knowledge ▾
Intro & Usage
Machine Learning Repo
Data Science Repo
Resources ▾
Intro & Usage
AI Tech Vault (Tech Wiki)
Industry News
Tech Blogs
Research Papers
Open Source Projects
Tools Hub ▾
🛠️ Tools & Skills Overview
🌐 Interactive Web Tools
🗺️ AI Industry & Career Map
🧭 AI Career Transition Navigator & Roadmap
📚 AI Multi-Module Practice Hub
🎯 AI Skill Assessment
🧠 AI Skills Library
AI Skills & Prompts Overview
Local Agent Guide
Cloud Skills Templates
⚡ MCP Tools Suite
TalentMe MCP Guide
CLI Tools & Commands
Services ▾
🚀 Services & Plans Suite
🧭 1v1 Coaching & Services
💎 Plans & Pricing
💬 Contact & Consultation
Contact Us
💬 Discord
🌐
中
☀️
🔑
Login / Register
☰
技术知识库
›
复习路线图
›
强化学习 思维导图
›
MPC 规划 (Model Predictive Control)
← 返回 强化学习 思维导图
中文
·
English
🎮 强化学习
ID:
mpc
MPC 规划 (Model Predictive Control)
Model Predictive Control (MPC)
🎯
核心定义
MPC (Model Predictive Control, 模型预测控制) 用已知或学到的环境模型,在每一步决策时对长度为
H
H
H
的有限时域做规划,最大化累计回报:
J
=
∑
k
=
0
H
−
1
γ
k
r
(
s
k
,
a
k
)
J = \sum_{k=0}^{H-1} \gamma^k \, r(s_k, a_k)
J
=
k
=
0
∑
H
−
1
γ
k
r
(
s
k
,
a
k
)
其中
s
k
+
1
∼
P
ϕ
(
⋅
∣
s
k
,
a
k
)
s_{k+1} \sim P_\phi(\cdot | s_k, a_k)
s
k
+
1
∼
P
ϕ
(
⋅
∣
s
k
,
a
k
)
由模型前向推出。规划器从当前状态
s
0
s_0
s
0
搜索动作序列
(
a
0
,
…
,
a
H
−
1
)
(a_0, \dots, a_{H-1})
(
a
0
,
…
,
a
H
−
1
)
,但只执行第一个动作,下个时刻重新规划——滚动时域 (receding horizon),每步都把新观测拉回真实轨迹,抵抗模型误差与扰动。
📌
核心概述
动作序列搜索
: ① Random Shooting——从先验分布均匀采样
K
K
K
条完整动作序列,按
J
J
J
评估取最优;简单但样本利用率低;② CEM (Cross-Entropy Method)——迭代改进:采样
K
K
K
条 → 按
J
J
J
保留 top-
ρ
\rho
ρ
精英 → 用精英拟合高斯分布(更新均值/方差) → 再采样,迭代若干轮后用最优分布的中心动作开局,通常比 Random Shooting 用更少样本找到更好解。
💡
使用场景
连续控制(机器人、自动驾驶、无人机)、有廉价仿真器/已知动力学模型的任务;MPC 不训练策略网络,"规划即策略",可即席换奖励目标。
⚡
解决的核心痛点
免去学策略所需的巨额采样,直接在线搜索最优动作;局限是受模型误差与有限时域
H
H
H
影响,
H
H
H
太小只见局部、
H
H
H
太大误差累积,且每步规划的计算开销高。
🎯
5 个高频面试考点 (Exam Points)
1
写出 MPC 的规划目标,并解释滚动时域 (receding horizon) 的含义与作用。
2
Random Shooting 与 CEM 分别如何搜索动作序列?CEM 的迭代流程?
3
MPC 相比学习策略函数(如 PPO/SAC 学出的 π)有哪些优缺点?
4
模型误差与有限时域 H 如何影响 MPC?H 取太小会怎样?
5
MPC 在机器人/自动驾驶中的典型用法?(轨迹优化 + 闭环重规划)
📖 关联深度指南:
📄 model-based-rl-and-planning →
更新于 2026-08-12
🎯
检验攻克程度:针对「MPC 规划 (Model Predictive Control)」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题 ➔
← 上一个知识点
Dyna 架构 (Dyna-Q)
下一个知识点 →
MuZero 潜空间模型
🔗 更多 强化学习 知识点卡片
Actor-Critic 框架
行为克隆 BC
上下文老虎机
思维链与推理强化