返回 多模态 思维导图
中文·English
👁️ 多模态ID: interleaved-data

图文交错训练数据

Interleaved Training Data
🎯核心定义
交错训练数据 (Interleaved Training Data) 是 VLM 预训练的数据金字塔, 按 图文对 → 交错文档 → 视频 三级组织, 数据配比直接决定能力上限。 第一级 图文对 (image-text pairs, 如 CC3M/LAION-5B): 每图配一条 caption, 对齐信号最强, 但风格单一 (短句描述), 教模型“看到什么说什么”; 第二级 交错文档 (interleaved documents, 如 OBELICS 约 1.15 亿网页文档 / MMC4): 文本中穿插多张图, 教会多图比较、图文交叉引用与长上下文推理; 第三级 视频 (video-text, 如 WebVid-10M): 按帧采样 (通常每段 4–8 帧) 扩展为时间维 token, 建立时序理解。 视觉 token 预算: 单图在 ViT patch size pp 下产生 Nvision=H/p×W/pN_{\text{vision}} = \lceil H/p \rceil \times \lceil W/p \rceil 个 token (LLaVA-1.5 的 336×336、patch 14 → 24×24 = 576 个), 视频再乘帧数 TT: Nvision=T×H/p×W/pN_{\text{vision}} = T \times \lceil H/p \rceil \times \lceil W/p \rceil
💡使用场景
VLM 预训练 (LLaVA/Qwen-VL/InternVL) 的数据组织与配比设计; 面试追问“数据从哪来、怎么配比、为什么这么配”; 也用于判断某个模型为什么擅长多图推理或时序理解。
解决的核心痛点
单一图文对数据能力单一 (对齐强却缺多图推理与长程能力), 纯交错文档又对齐弱; 三级金字塔按比例混合 (如 Flamingo 的 图文对: 交错文档: 视频), 使模型同时获得 单图对齐、多图/长上下文推理、时序理解 三类能力——图文对过多则只会单图 QA, 交错文档过多则图文对齐差, 数据配比 ≈ 能力上限 (数据工程即能力工程)。
🎯5 个高频面试考点 (Exam Points)
1
VLM 预训练数据的三级金字塔是什么?每一级的特点与作用?
2
图文对、交错文档、视频的配比如何影响 VLM 能力上限?
3
OBELICS / MMC4 / WebVid-10M 各是什么数据?交错文档带来什么独特能力?
4
一张 336×336 图像在 ViT patch=14 下产生多少视觉 token?视频帧如何扩展?
5
交错数据 vs 图文对数据: 哪个对多图推理与长上下文更关键?为什么?
📖 关联深度指南:📄 vision-language-models
更新于 2026-08-12
🎯
检验攻克程度:针对「图文交错训练数据」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点视觉编码器下一个知识点VLM 能力图谱

🔗 更多 多模态 知识点卡片

语音识别 ASR音频表示Classifier-Free Guidance (CFG)CLIP 应用