交错训练数据 (Interleaved Training Data) 是 VLM 预训练的数据金字塔, 按 图文对 → 交错文档 → 视频 三级组织, 数据配比直接决定能力上限。
第一级 图文对 (image-text pairs, 如 CC3M/LAION-5B): 每图配一条 caption, 对齐信号最强, 但风格单一 (短句描述), 教模型“看到什么说什么”;
第二级 交错文档 (interleaved documents, 如 OBELICS 约 1.15 亿网页文档 / MMC4): 文本中穿插多张图, 教会多图比较、图文交叉引用与长上下文推理;
第三级 视频 (video-text, 如 WebVid-10M): 按帧采样 (通常每段 4–8 帧) 扩展为时间维 token, 建立时序理解。
视觉 token 预算: 单图在 ViT patch size
p 下产生
Nvision=⌈H/p⌉×⌈W/p⌉ 个 token (LLaVA-1.5 的 336×336、patch 14 → 24×24 = 576 个), 视频再乘帧数
T:
Nvision=T×⌈H/p⌉×⌈W/p⌉。