返回 强化学习 思维导图
中文·English
🎮 强化学习ID: robotics-embodied

具身智能与机器人

Embodied AI & Robotics
🎯核心定义
具身智能把 RL/规划与视觉世界模型结合用于机器人控制:V-JEPA 在潜空间做视觉特征预测 (视觉世界模型),Diffusion Policy 直接预测多峰连续动作分布——高斯策略无法表达多峰动作,扩散策略天然支持。
💡使用场景
机械臂操作/导航等连续动作控制、跨任务泛化与样本高效学习;面试常从"RL 与视觉模型的结合"切入。
解决的核心痛点
多峰动作分布建模与真实交互样本效率。详见 Multimodal 模块: V-JEPA 与 Diffusion Policy 的完整内容见 Multimodal 模块对应卡 (指南 world-models-jepa)。
🎯5 个高频面试考点 (Exam Points)
1
具身智能中 RL 与视觉世界模型如何分工?V-JEPA 的作用?
2
为什么高斯策略无法建模多峰动作?Diffusion Policy 如何解决?
3
机器人 RL 的样本效率瓶颈?世界模型/演示数据如何缓解?
4
具身智能与 LLM 推理强化的共性 (预测/规划/世界模型)?
5
V-JEPA 潜空间预测与显式像素预测的对比?各自优劣?
📖 关联深度指南:📄 world-models-jepa
更新于 2026-08-12
🎯
检验攻克程度:针对「具身智能与机器人」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点基于模型 vs 无模型 (MB vs MF)下一个知识点GRPO 组相对策略优化

🔗 更多 强化学习 知识点卡片

Actor-Critic 框架行为克隆 BC上下文老虎机思维链与推理强化