TalentMe
How To
🗺️
AI Industry Map
NEW
Knowledge ▾
Intro & Usage
Machine Learning Repo
Data Science Repo
Resources ▾
Intro & Usage
AI Tech Vault (Tech Wiki)
Industry News
Tech Blogs
Research Papers
Open Source Projects
Tools Hub ▾
🛠️ Tools & Skills Overview
🌐 Interactive Web Tools
🗺️ AI Industry & Career Map
🧭 AI Career Transition Navigator & Roadmap
📚 AI Multi-Module Practice Hub
🎯 AI Skill Assessment
🧠 AI Skills Library
AI Skills & Prompts Overview
Local Agent Guide
Cloud Skills Templates
⚡ MCP Tools Suite
TalentMe MCP Guide
CLI Tools & Commands
Services ▾
🚀 Services & Plans Suite
🧭 1v1 Coaching & Services
💎 Plans & Pricing
💬 Contact & Consultation
Contact Us
💬 Discord
🌐
中
☀️
🔑
Login / Register
☰
技术知识库
›
复习路线图
›
多模态 思维导图
›
视频生成
← 返回 多模态 思维导图
中文
·
English
👁️ 多模态
ID:
video-generation
视频生成
Video Generation
🎯
核心定义
视频生成在图像扩散框架上加入
时间维建模
,把视频视为高维张量
x
∈
R
F
×
H
×
W
×
3
x \in \mathbb{R}^{F \times H \times W \times 3}
x
∈
R
F
×
H
×
W
×
3
(
F
F
F
帧 RGB)。扩散式视频模型沿用 DDPM 的噪声预测目标
E
t
,
x
,
ϵ
[
∥
ϵ
−
ϵ
θ
(
x
t
,
t
,
c
)
∥
2
]
\mathbb{E}_{t,x,\epsilon}\left[\Vert \epsilon - \epsilon_\theta(x_t, t, c) \Vert^2\right]
E
t
,
x
,
ϵ
[
∥
ϵ
−
ϵ
θ
(
x
t
,
t
,
c
)
∥
2
]
,差异集中在时序建模方式:
📌
核心概述
1.
3D 卷积 U-Net
(Video Diffusion Models):把 U-Net 的 2D 卷积替换为时空 3D 卷积,帧间共享参数、隐式建模时序,与图像训练无缝衔接,但时序感受野有限;
📌
核心概述
2.
时空分离注意力
:先空间注意力后时间注意力,复杂度从
O
(
F
2
H
2
W
2
)
O(F^2 H^2 W^2)
O
(
F
2
H
2
W
2
)
降到
O
(
F
H
W
⋅
(
F
H
+
H
W
)
)
O(FHW \cdot (FH + HW))
O
(
F
H
W
⋅
(
F
H
+
H
W
))
,训练显存可控,是 ManyWorlds/VDM 的过渡方案;
📌
核心概述
3.
因果时空注意力
(Sora 系 DiT):注意力 mask 令第
t
t
t
帧只能 attend 到
t
′
≤
t
t' \le t
t
′
≤
t
的帧(
M
i
,
j
=
−
∞
,
∀
t
j
>
t
i
M_{i,j} = -\infty, \; \forall t_j > t_i
M
i
,
j
=
−
∞
,
∀
t
j
>
t
i
),显式建模因果时序,支持任意时长/分辨率推理。
📌
核心概述
级联生成
(cascade)是标配:先以低时空分辨率生成主干(潜帧
F
/
4
×
H
/
8
×
W
/
8
F/4 \times H/8 \times W/8
F
/4
×
H
/8
×
W
/8
),再经两级时空超分逐步放大到 1080p,每级独立训练、顺序推理,显著降低显存与采样成本。
💡
使用场景
文生视频(Sora / Kling / Veo / Runway Gen-3)、图生视频、视频延展与编辑;面试常追问三种时序建模的取舍与级联分工。
⚡
解决的核心痛点
视频数据稀缺、静态/重复片段多、文本-视频对齐差;级联 + 因果建模让模型先在低分辨率学全局运动、再在高分辨率学纹理细节,缓解帧间闪烁、运动漂移与单次大生成不可控,把视频生成拆成可控多级管线。
🎯
5 个高频面试考点 (Exam Points)
1
视频扩散如何建模时间维?3D 卷积 / 时空分离注意力 / 因果注意力三种方式的取舍?
2
因果注意力 mask 怎么写?它解锁了哪些生成能力(任意时长/分辨率)?
3
什么是级联生成?两级时空超分各自负责什么?
4
视频生成常见伪影(闪烁/漂移/重复)的原因与缓解手段?
5
视频训练数据的主要挑战?与图像数据相比缺什么?
📖 关联深度指南:
📄 diffusion-models →
更新于 2026-08-12
🎯
检验攻克程度:针对「视频生成」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题 ➔
← 上一个知识点
采样加速 (DDIM/DPM-Solver/LCM)
下一个知识点 →
DiT 与 3D Causal VAE
🔗 更多 多模态 知识点卡片
语音识别 ASR
音频表示
Classifier-Free Guidance (CFG)
CLIP 应用