OpenAI Sora 式大规模视频生成世界模型与 3D 时空潜空间 Patch 架构 (Sora-Style Video World Models & 3D Spacetime Latent Patch Architectures) 是将生成式 AI 从静态 2D 图像推向具备物理规律理解、空间一致性与时序动力学模拟的世界模拟器 (World Simulators) 的里程碑技术;核心架构体系:1) 3D 时空潜空间压缩器 (3D Spacetime VAE / Video Compression Network): 将任意分辨率、任意宽高比与任意时长的视频张量
(T×H×W×C) 在时间和空间维度联合压缩进低维连续 Latent 空间;2) 3D Spacetime Patches (时空补丁化): 将连续潜空间切分为网格式的 3D Patches(如
2×16×16),拉平成一维序列,使得视频生成能够直接无缝借用标准 Transformer (Diffusion Transformer, DiT) 进行全自注意力时空联合建模;3) 涌现物理规律模拟:大规模 Scaling 训练下模型自发展现出三维几何一致性、持久物体遮挡记忆与简单的物理世界动力学模拟。