M6-092M6: Multimodal & Generative ModelsVideo, 3D & Audio Generative ModelsEasy
Mastery:
Video, 3D & Audio Generative Models: 解释视频生成相对图像生成的主要挑战。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 时间一致性(帧间不闪烁)、运动建模、长时序依赖、以及 token 数与成本(帧数 × 每帧 token)。
📌 Key Takeaways
- •时间一致性:相邻帧不能闪烁/跳变(最核心)
- •运动建模:需理解物理运动与因果关系
- •成本:帧数 × 每帧 token → 注意力成本爆炸
- •长时序:长视频的全局一致性与剧情连贯
📐 Mathematical Derivations
数学机理:<strong>四个主要挑战</strong>。(1) <strong>时间一致性(temporal consistency)</strong>——相邻帧必须<strong>连贯</strong>(不闪烁、不跳变、物体不'瞬移');这是视频生成的<strong>核心难题</strong>——因为 (a) 图像模型逐帧独立生成会导致<strong>闪烁</strong>(每帧的纹理/光照略有不同);(b) 需模型显式建模'帧间的对应关系'。(2) <strong>运动建模</strong>——需理解 (a) <strong>物理运动</strong>(重力、碰撞、流体);(b) <strong>因果关系</strong>('球被踢→飞出去');(c) <strong>复杂动作</strong>(人物的连续动作);这比'静态图像'难得多(静态图只需'合理',视频需'物理与因果合理')。(3) <strong>成本爆炸</strong>——视频的 token 数 = T(帧数)× 每帧 token;故 (a) <strong>注意力成本 ∝ (T·H·W)²</strong>(若用全局时空注意力);(b) <strong>VAE 潜空间</strong>——视频常用<strong>时空 VAE</strong>(时间维也压缩,如 4~8 倍);(c) 生成 5 秒 24fps 的 720p 视频 = 120 帧 × (720/8 × 1280/8) 潜变量 → 巨大的序列长度(数万 token);故需<strong>时空注意力 + 分块</strong>。(4) <strong>长时序依赖</strong>——长视频(分钟级)的 (a) <strong>全局一致性</strong>(人物/场景不变);(b) <strong>剧情连贯</strong>(事件顺序);(c) <strong>长程依赖</strong>(开头的元素在结尾出现);这需要'记忆'机制(如关键帧参考、长上下文)。<strong>其他挑战</strong>——(a) <strong>数据稀缺</strong>(高质量视频远少于图像);(b) <strong>评估困难</strong>(时序质量难自动评估,见多图/视频评估题);(c) <strong>可控性</strong>(视频编辑/控制比图像难);(d) <strong>计算资源</strong>(训练与推理都极贵)。<strong>技术路线</strong>——(1) <strong>时空注意力</strong>(见下一题);(2) <strong>时空 VAE</strong>(时间维压缩);(3) <strong>分块生成 + 拼接</strong>(避免全局注意力的成本);(4) <strong>关键帧 + 插帧</strong>(先生成关键帧、再插值中间帧);(5) <strong>图像模型 + 运动模块</strong>(如 AnimateDiff 用图像模型 + 时间注意力层);(6) <strong>原生视频 DiT</strong>(如 Sora 用时空 patch 的 DiT)。<strong>评估</strong>——(a) <strong>时间一致性</strong>(光流平滑度、帧间特征相似度);(b) <strong>运动合理性</strong>(人工或物理约束);(c) <strong>文本对齐</strong>(视频-文本相似度);(d) <strong>视觉质量</strong>(FVD 等);(e) <strong>人工评估</strong>(仍是主要方法)。<strong>实践建议</strong>——(a) <strong>短片段优先</strong>(长视频难);(b) <strong>时空 VAE 降成本</strong>;(c) <strong>关键帧 + 插帧</strong>(比直接生成长视频更稳);(d) <strong>明确评估维度</strong>(一致性/运动/对齐)。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'时间一致性是最核心挑战'</strong>——它区分了'视频生成'与'逐帧图像生成';面试中能指出这一点是深度理解的标志。② <strong>'成本 ∝ (T·H·W)²'是根本约束</strong>——故视频生成需要时空压缩(时空 VAE)与分块;这解释了'为什么视频生成如此昂贵'。③ <strong>'运动/因果建模'比静态图像难</strong>——因为需要'物理与世界模型'的知识(而非仅'合理的外观')。④ <strong>'长时序依赖需记忆机制'</strong>——长视频的全局一致性需要'参考帧/长上下文';这是当前研究的重点。⑤ <strong>'数据稀缺'是训练瓶颈</strong>——高质量视频数据远少于图像;故常 (a) 用图像数据预训练、(b) 用视频数据微调。⑥ <strong>面试要点</strong>——被问'视频生成难在哪',应给出'<strong>时间一致性 + 运动/因果建模 + 成本爆炸((THW)²)+ 长时序依赖 + 数据稀缺</strong>'与'<strong>技术路线(时空注意力/时空 VAE/分块/关键帧+插帧)</strong>';能指出'时间一致性是核心'是深度理解的标志。
⚠️ Common Interview Pitfalls
- ✕忽略时间一致性(逐帧生成导致闪烁)
- ✕不考虑成本(直接全时空注意力)
🎯 Interviewer Follow-ups
- ?为什么'时间一致性'最难?
- ?视频的 token 数怎么算?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.