M6-093M6: Multimodal & Generative ModelsVideo, 3D & Audio Generative ModelsEasy
Mastery:
Video, 3D & Audio Generative Models: 解释视频生成中的时空注意力设计。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 三种设计:全时空注意力(最贵)、时空分离(先空间后时间)、以及分块/窗口;需在质量与成本间权衡。
📌 Key Takeaways
- •全时空:所有帧所有位置互相注意(最贵、最强)
- •时空分离:先做空间注意力(每帧内)、再做时间注意力(跨帧同位置)
- •分块/窗口:局部时空窗口(成本最低)
📐 Mathematical Derivations
数学机理:<strong>三种设计</strong>。(1) <strong>全时空注意力(full spatio-temporal)</strong>——把所有帧的所有 patch 展平为一个长序列,做全局自注意力;<strong>复杂度</strong> O((T·H·W)²);<strong>优点</strong>——最强(任意帧任意位置可交互);<strong>缺点</strong>——成本极高(T 稍大就不可行)。(2) <strong>时空分离注意力(factorized / separated)</strong>——把注意力<strong>分解</strong>为两步:(a) <strong>空间注意力</strong>——在<strong>每一帧内部</strong>做自注意力(所有帧并行):复杂度 O((HW)²·T);(b) <strong>时间注意力</strong>——在<strong>同一空间位置跨帧</strong>做注意力:复杂度 O(T²·HW)。<strong>总复杂度</strong> O((HW)²T+T²HW) ≪ O((THW)²)(因为 T 与 HW 是'相加'而非'相乘')。<strong>为什么时间注意力要'同位置'</strong>——因为'同一空间位置在不同帧'对应'同一个物体/区域'(如'第 3 帧的左上角'与'第 4 帧的左上角');这样时间注意力建模'该位置如何随时间变化'(运动),而空间注意力建模'该帧内的空间关系'。<strong>优点</strong>——成本大幅降低、且符合'空间与时间可分离'的先验;<strong>缺点</strong>——无法建模'跨帧的跨位置'关系(如'第 3 帧左上角的物体移动到第 5 帧右下角'——这在分离注意力中需两步传递)。(3) <strong>分块/窗口注意力</strong>——(a) <strong>时空窗口</strong>(如 3D 窗口,只在局部时空块内注意);(b) <strong>分块生成</strong>(把视频切成片段,各自生成 + 拼接);(c) <strong>稀疏注意力</strong>(只对部分帧/位置)。<strong>优点</strong>——成本最低;<strong>缺点</strong>——长程依赖受限。<strong>其他设计</strong>——(a) <strong>混合</strong>(部分层用全时空、部分用分离);(b) <strong>层次化</strong>(先在低分辨率做全时空、再高分辨率做分离);(c) <strong>隐式运动建模</strong>(用光流或运动 token 辅助);(d) <strong>参考帧机制</strong>(长视频用关键帧作为参考,避免全局注意力)。<strong>代表实现</strong>——(a) <strong>AnimateDiff</strong>——在图像扩散模型的注意力层间<strong>插入时间注意力层</strong>(只训时间层);(b) <strong>Sora</strong>——用时空 patch 的 DiT(架构细节未完全公开);(c) <strong>CogVideoX / Open-Sora</strong>——用时空分离或 3D 注意力;(d) <strong>Wan / HunyuanVideo</strong>——3D VAE + DiT。<strong>选择依据</strong>——(a) <strong>短视频、质量优先</strong> → 全时空或混合;(b) <strong>中等长度</strong> → 时空分离(主流);(c) <strong>长视频</strong> → 分块 + 参考帧 + 稀疏注意力。<strong>评估</strong>——(a) 时间一致性(光流/帧间特征);(b) 成本(延迟/显存);(c) 长程一致性(长视频的全局一致)。<strong>实践建议</strong>——(a) <strong>时空分离是主流折中</strong>;(b) <strong>3D VAE 压缩时间维</strong>(降低 T 的有效值);(c) <strong>长视频用分块 + 参考帧</strong>。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'时空分离把乘法变加法'是关键</strong>——复杂度从 (THW)² 降到 (HW)²T+T²HW;面试中能给出这一复杂度对比是深度理解的标志。② <strong>'时间注意力在同位置'符合'运动'的直觉</strong>——同位置跨帧对应'同一物体的时间演化'。③ <strong>'分离的局限是跨帧跨位置'</strong>——需要多步传递(削弱长程时空依赖);故有混合/层次化设计。④ <strong>'插入时间注意力层'是低成本的微调方案</strong>(AnimateDiff)——复用图像模型 + 只训时间层;这大幅降低训练成本。⑤ <strong>'3D VAE 压缩时间维'是必要的</strong>——否则 T 太大(成本爆炸);故视频生成普遍用时空 VAE。⑥ <strong>面试要点</strong>——被问'视频的注意力怎么设计',应给出'<strong>全时空(最贵最强)/ 时空分离(主流折中,乘法变加法)/ 分块窗口(最省)</strong>'与'<strong>时间注意力在同位置、跨帧跨位置需多步传递</strong>';能给出复杂度对比是深度理解的标志。
⚠️ Common Interview Pitfalls
- ✕用全时空注意力处理长视频(成本爆炸)
- ✕忽略时间注意力'同位置'的设计动机
🎯 Interviewer Follow-ups
- ?时空分离为什么能省这么多?
- ?时间注意力为什么要'同位置'?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.