返回 多模态 思维导图
中文·English
👁️ 多模态ID: video-generation

视频生成

Video Generation
🎯核心定义
视频生成在图像扩散框架上加入时间维建模,把视频视为高维张量 xRF×H×W×3x \in \mathbb{R}^{F \times H \times W \times 3}(FF 帧 RGB)。扩散式视频模型沿用 DDPM 的噪声预测目标 Et,x,ϵ[ϵϵθ(xt,t,c)2]\mathbb{E}_{t,x,\epsilon}\left[\Vert \epsilon - \epsilon_\theta(x_t, t, c) \Vert^2\right],差异集中在时序建模方式:
📌核心概述
1. 3D 卷积 U-Net(Video Diffusion Models):把 U-Net 的 2D 卷积替换为时空 3D 卷积,帧间共享参数、隐式建模时序,与图像训练无缝衔接,但时序感受野有限;
📌核心概述
2. 时空分离注意力:先空间注意力后时间注意力,复杂度从 O(F2H2W2)O(F^2 H^2 W^2) 降到 O(FHW(FH+HW))O(FHW \cdot (FH + HW)),训练显存可控,是 ManyWorlds/VDM 的过渡方案;
📌核心概述
3. 因果时空注意力(Sora 系 DiT):注意力 mask 令第 tt 帧只能 attend 到 ttt' \le t 的帧(Mi,j=,  tj>tiM_{i,j} = -\infty, \; \forall t_j > t_i),显式建模因果时序,支持任意时长/分辨率推理。
📌核心概述
级联生成(cascade)是标配:先以低时空分辨率生成主干(潜帧 F/4×H/8×W/8F/4 \times H/8 \times W/8),再经两级时空超分逐步放大到 1080p,每级独立训练、顺序推理,显著降低显存与采样成本。
💡使用场景
文生视频(Sora / Kling / Veo / Runway Gen-3)、图生视频、视频延展与编辑;面试常追问三种时序建模的取舍与级联分工。
解决的核心痛点
视频数据稀缺、静态/重复片段多、文本-视频对齐差;级联 + 因果建模让模型先在低分辨率学全局运动、再在高分辨率学纹理细节,缓解帧间闪烁、运动漂移与单次大生成不可控,把视频生成拆成可控多级管线。
🎯5 个高频面试考点 (Exam Points)
1
视频扩散如何建模时间维?3D 卷积 / 时空分离注意力 / 因果注意力三种方式的取舍?
2
因果注意力 mask 怎么写?它解锁了哪些生成能力(任意时长/分辨率)?
3
什么是级联生成?两级时空超分各自负责什么?
4
视频生成常见伪影(闪烁/漂移/重复)的原因与缓解手段?
5
视频训练数据的主要挑战?与图像数据相比缺什么?
📖 关联深度指南:📄 diffusion-models
更新于 2026-08-12
🎯
检验攻克程度:针对「视频生成」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点采样加速 (DDIM/DPM-Solver/LCM)下一个知识点DiT 与 3D Causal VAE

🔗 更多 多模态 知识点卡片

语音识别 ASR音频表示Classifier-Free Guidance (CFG)CLIP 应用