返回 多模态 思维导图
中文·English
👁️ 多模态ID: video-training-pipeline

视频渐进训练

Progressive Video Training
🎯核心定义
文生视频采用三阶段渐进式训练(Sora、Stable Video Diffusion、Kling 等通用配方),逐步引入视频分布:
📌核心概述
1. 图像预训练: 先用海量图文对训练(或加载现成文生图权重),学会静态语义、构图与文本对齐——图像数据多、质量高、成本低,为模型提供“静态先验”;
📌核心概述
2. 图文视频联合训练: 加入短视频片段(通常 3-10 秒、256-512p),与图像按比例混合(视频占比通常仅 5%-20%),训练 3D 模块(3D 卷积或因果注意力)学习运动与帧间一致性;
📌核心概述
3. 高清微调: 逐步提高分辨率(256→480→720p→1080p)与时长(4s→16s→更长),用高质量精选数据、小学习率微调,在已学好的运动分布上“叠加”高频纹理细节,避免高分辨率直接训练的算力爆炸。
📌核心概述
宽高比分桶(aspect-ratio bucketing): 训练前按宽高比/分辨率将样本分桶(如 16:9、9:16、1:1),一个 batch 内所有样本同桶同尺寸,避免粗暴 resize 造成几何畸变与构图偏差,是 SD/Sora 训练标配。
📌核心概述
光流过滤(motion filtering): 用光流模型(如 RAFT)或帧差估计每段视频的动态程度,丢弃静态、纯字幕、低运动样本(光流幅值低于阈值),并辅助筛选文本-视频对齐差的样本,保证训练数据“动起来”且与文本相关。
💡使用场景
文生视频模型训练/续训;面试常追问三阶段的冻结策略、数据配比与高清微调细节。
解决的核心痛点
直接高分辨率、长时长端到端训练视频模型,数据稀缺且算力爆炸;渐进式配方让模型先学分布主体(静态+低分辨率运动)、再学边缘细节,分桶与光流过滤净化数据,以最小算力达到最好的时序质量与构图,是视频扩散训练工程的通用最优解。
🎯5 个高频面试考点 (Exam Points)
1
视频训练三阶段各自训什么?为什么顺序不能反?
2
宽高比分桶解决什么问题?一个 batch 内的样本如何组织?
3
为什么要用光流过滤训练数据?阈值如何设定?
4
高清微调阶段如何设置学习率与数据选择?
5
图像预训练为什么对视频生成有帮助?
📖 关联深度指南:📄 diffusion-models
更新于 2026-08-12
🎯
检验攻克程度:针对「视频渐进训练」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点扩散训练目标 (ε/v-pred 与 Zero-SNR)下一个知识点音频表示

🔗 更多 多模态 知识点卡片

语音识别 ASRClassifier-Free Guidance (CFG)CLIP 应用CLIP 双塔架构