🎯核心定义
文生视频采用三阶段渐进式训练(Sora、Stable Video Diffusion、Kling 等通用配方),逐步引入视频分布:
📌核心概述
1. 图像预训练: 先用海量图文对训练(或加载现成文生图权重),学会静态语义、构图与文本对齐——图像数据多、质量高、成本低,为模型提供“静态先验”;
📌核心概述
2. 图文视频联合训练: 加入短视频片段(通常 3-10 秒、256-512p),与图像按比例混合(视频占比通常仅 5%-20%),训练 3D 模块(3D 卷积或因果注意力)学习运动与帧间一致性;
📌核心概述
3. 高清微调: 逐步提高分辨率(256→480→720p→1080p)与时长(4s→16s→更长),用高质量精选数据、小学习率微调,在已学好的运动分布上“叠加”高频纹理细节,避免高分辨率直接训练的算力爆炸。
📌核心概述
宽高比分桶(aspect-ratio bucketing): 训练前按宽高比/分辨率将样本分桶(如 16:9、9:16、1:1),一个 batch 内所有样本同桶同尺寸,避免粗暴 resize 造成几何畸变与构图偏差,是 SD/Sora 训练标配。
📌核心概述
光流过滤(motion filtering): 用光流模型(如 RAFT)或帧差估计每段视频的动态程度,丢弃静态、纯字幕、低运动样本(光流幅值低于阈值),并辅助筛选文本-视频对齐差的样本,保证训练数据“动起来”且与文本相关。
💡使用场景
文生视频模型训练/续训;面试常追问三阶段的冻结策略、数据配比与高清微调细节。
⚡解决的核心痛点
直接高分辨率、长时长端到端训练视频模型,数据稀缺且算力爆炸;渐进式配方让模型先学分布主体(静态+低分辨率运动)、再学边缘细节,分桶与光流过滤净化数据,以最小算力达到最好的时序质量与构图,是视频扩散训练工程的通用最优解。