M6-038M6: Multimodal & Generative ModelsVLM Training & EvaluationHard
Mastery:

VLM Training & Evaluation: 解释 VLM 指令微调数据的构造与质量控制。

📐 Mathematical Definition
Dinstruct={(image,instruction,answer)};GPT-4+image→data\mathcal{D}_{\text{instruct}}=\{(\text{image},\text{instruction},\text{answer})\};\qquad \text{GPT-4}+\text{image}\to\text{data}
⚡ Executive Summary
Core Concept: 用强模型(GPT-4)生成多模态指令数据(LLaVA-Instruct 范式);需覆盖多样任务、保证答案准确、并做质量过滤。

📌 Key Takeaways

  • •
    做法:把图像转成'文本表示'(caption + 框)喂给 GPT-4,让它生成问答
  • •
    覆盖任务:描述、问答、推理、OCR、拒绝、多轮
  • •
    质量:答案准确性、多样性、难度分布、幻觉控制

📐 Mathematical Derivations

数学机理:<strong>LLaVA-Instruct 的构造范式</strong>——核心难题是'GPT-4 不能直接看图'(当时);解法是<strong>把图像转成文本表示</strong>:(1) <strong>提取图像的文本描述</strong>——用现成的检测/描述模型得到 (a) <strong>caption</strong>(整体描述)、(b) <strong>物体列表 + 边界框</strong>(如'猫 (0.2,0.3,0.5,0.6)');(2) <strong>喂给纯文本 GPT-4</strong>——把'图像文本表示'作为上下文,让 GPT-4 <strong>生成多轮对话/问答</strong>(如'图中有几只猫?'→'2 只');(3) <strong>得到 (图像, 指令, 回答) 三元组</strong>——图像用真实图像,指令与回答来自 GPT-4。<strong>任务覆盖</strong>——(a) <strong>对话</strong>(多轮问答);(b) <strong>详细描述</strong>(要求长描述);(c) <strong>复杂推理</strong>(需要多步思考的问题);(d) <strong>OCR/文字</strong>;(e) <strong>拒绝</strong>(对不明确的问题说'图中未显示')。<strong>规模</strong>——LLaVA 用 158k(对话 58k + 详细描述 23k + 复杂推理 77k);后续工作(Allava、ShareGPT4V)扩展到百万级。<strong>为什么用 GPT-4 而非人工</strong>——(a) <strong>成本</strong>(人工标注多模态指令极贵);(b) <strong>规模</strong>(可生成大量数据);(c) <strong>质量</strong>(GPT-4 的回答质量高、格式一致)。<strong>风险与质量控制</strong>——(1) <strong>幻觉继承</strong>——GPT-4 基于'图像文本表示'生成,若表示不完整/错误,则答案可能有幻觉(它'看不到'图,只能靠文本表示);故 LLaVA 的数据<strong>在细节上可能不准</strong>(这也是 VLM 幻觉的来源之一)。(2) <strong>同质化</strong>——单一模型的风格被复制(见 M5 的合成数据风险)。(3) <strong>分布偏差</strong>——覆盖的任务类型有限。(4) <strong>污染</strong>——生成的题目可能含基准内容。<strong>质量过滤手段</strong>——(a) <strong>用真实图像的视觉信息校验</strong>(如用 VLM 检查答案是否被图支持);(b) <strong>多样性控制</strong>(多模板、多任务类型、多难度);(c) <strong>去重</strong>;(d) <strong>人工抽检</strong>;(e) <strong>用更强的多模态模型生成</strong>(如后续用 GPT-4V 直接生成,质量更高)。<strong>改进方向</strong>——(a) <strong>用多模态强模型生成</strong>(GPT-4V/Gemini 直接看图生成数据,避免'文本表示'的信息损失);(b) <strong>细粒度偏好数据</strong>(如 RLHF-V 的逐句标注,用于减少幻觉);(c) <strong>任务特化数据</strong>(OCR/图表/文档的专门数据);(d) <strong>合成图像的配对数据</strong>(程序生成'图 + 精确标注',质量可控)。<strong>评估</strong>——(a) <strong>数据质量抽检</strong>(人工判断答案是否正确/被图支持);(b) <strong>多样性度量</strong>(任务类型/长度/难度的分布);(c) <strong>训练后的任务指标</strong>(数据质量最终由模型表现验证)。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>'把图像转成文本表示'是 LLaVA 的巧妙之处</strong>——它绕过了'GPT-4 不能看图'的限制;但也引入了<strong>信息损失</strong>(细节丢失 → 数据中的细节可能不准 → VLM 幻觉)。② <strong>'数据质量决定 VLM 上限'</strong>——尤其指令数据;故后续工作的重点从'扩大规模'转向'提升质量'(用更强模型生成 + 精细过滤)。③ <strong>'幻觉继承'是主要风险</strong>——若教师模型基于不完整的图像表示生成,其错误会被学生继承;故需 (a) 更完整的图像表示、(b) 用多模态教师、(c) 视觉校验。④ <strong>'细粒度偏好数据'的价值</strong>——RLHF-V 用 1.4k 条逐句标注的偏好数据显著减少幻觉;说明'精准的小数据'在减少幻觉上比'海量指令数据'更有效。⑤ <strong>'任务覆盖'的重要性</strong>——若数据缺少 OCR/图表任务,模型在这些任务上就差;故需<strong>显式覆盖</strong>关键能力(这也是'能力不均衡'的来源)。⑥ <strong>面试要点</strong>——被问'VLM 指令数据怎么造',应给出'<strong>图像→文本表示→GPT-4 生成(LLaVA 范式)+ 任务覆盖(对话/描述/推理/OCR/拒绝)+ 质量控制(视觉校验/多样性/去重/抽检)</strong>'与'<strong>幻觉继承是主要风险</strong>';能指出'细粒度偏好数据对小幻觉高效'是深度理解的标志。
⚠️ Common Interview Pitfalls
  • ✕
    用单一模型生成全部数据(同质化)
  • ✕
    不校验答案是否被图支持(继承幻觉)
🎯 Interviewer Follow-ups
  • ?
    为什么用 GPT-4 生成而不人工标注?
  • ?
    生成数据的主要风险是什么?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM6-037: VLM Training & Evaluation: 解释 VLM 的效率优化方向。📋Back to BankNext →M6-039: VLM Training & Evaluation: 解释 VLM 评估基准(MMMU / MMBench / MMVP)的特点与陷阱。