🎯核心定义
世界模型应用指把学到的环境动态先验用于三大任务——视频预测/理解: V-JEPA 在潜空间预测未来表示而不重建像素;视频生成: Sora 用 DiT + 3D VAE 时空压缩 (空 8×、时 4–8×) 生成视频, 可视为生成式世界模型——与 JEPA 形成对照: JEPA 求语义表示, Sora 求像素;规划: RL 中用世界模型生成"想象 rollout"供策略训练与 MPC 规划 (详见 RL 模块, 指南 model-based-rl-and-planning)。
💡使用场景
视频理解/生成、具身规划、世界模型专题面试; 常问"V-JEPA 与 Sora 的定位差异"。
⚡解决的核心痛点
理解、生成、决策三者常各自为政; 世界模型用同一动态先验统一它们——V-JEPA 以低成本获得语义表示, Sora 以生成验证动态合理性, 想象 rollout 把 RL 样本效率提升约一个数量级。