M6-033M6: Multimodal & Generative ModelsVLM Training & EvaluationEasy
Mastery:

VLM Training & Evaluation: 列举 VLM 的主要评估基准与能力维度。

📐 Mathematical Definition
MMMU,MMBench,MMVP,DocVQA,ChartQA,RealWorldQA,MathVista\text{MMMU},\text{MMBench},\text{MMVP},\text{DocVQA},\text{ChartQA},\text{RealWorldQA},\text{MathVista}
⚡ Executive Summary
Core Concept: 维度:识别/OCR/文档/图表/空间/推理/知识/多图/视频;基准:MMMU/MMBench/MMVP/DocVQA/ChartQA/RealWorldQA。

📌 Key Takeaways

  • •
    识别与 OCR:DocVQA、OCRBench、TextVQA
  • •
    推理与知识:MMMU(学科推理)、MathVista(数学)、ScienceQA
  • •
    细粒度与鲁棒:MMVP(CLIP 盲对)、RealWorldQA、POPE(幻觉)

📐 Mathematical Derivations

数学机理:<strong>能力维度与对应基准</strong>。(1) <strong>通用视觉识别</strong>——(a) <strong>MMBench</strong>(多维度多选题,含能力细分);(b) <strong>SEED-Bench</strong>;(c) <strong>MME</strong>(感知 + 认知)。(2) <strong>OCR 与文档</strong>——(a) <strong>DocVQA</strong>(文档问答);(b) <strong>TextVQA</strong>(自然场景文字);(c) <strong>OCRBench</strong>(OCR 综合);(d) <strong>InfoVQA</strong>(信息图)。(3) <strong>图表理解</strong>——<strong>ChartQA</strong>、<strong>PlotQA</strong>(读图表数值)。(4) <strong>学科推理与知识</strong>——(a) <strong>MMMU</strong>(大学级学科题,含图表);(b) <strong>ScienceQA</strong>;(c) <strong>MathVista / MathVerse</strong>(数学推理)。(5) <strong>细粒度与鲁棒性</strong>——(a) <strong>MMVP(CLIP 盲对)</strong>——由'CLIP 看不出但人类明显'的图像对构成,测'真正的视觉理解'(而非依赖语言先验);(b) <strong>RealWorldQA</strong>(真实场景空间理解);(c) <strong>POPE</strong>(幻觉评估,用'是否存在某物体'的问答测幻觉)。(6) <strong>多图与交错</strong>——(a) <strong>NLVR2</strong>(两张图的关系);(b) <strong>多图 QA</strong>;(c) <strong>Interleaved 基准</strong>(如 MMMU 中的多图题)。(7) <strong>视频</strong>——(a) <strong>Video-MME</strong>;(b) <strong>MVBench</strong>;(c) <strong>TempCompass</strong>(时序理解)。(8) <strong>Agent/工具使用</strong>——(a) <strong>OSWorld / WebArena</strong>(GUI 操作);(b) <strong>V*Bench</strong>(高分辨率细节搜索)。<strong>为什么单一基准不够</strong>——(a) <strong>能力不均衡</strong>——模型可能 OCR 强但推理弱(或反之);(b) <strong>捷径(shortcut)</strong>——模型可能靠'语言先验'答对(不看图也能猜),如'图中有几只动物'→猜'2';故需 <strong>MMVP</strong> 这类'必须看图'的基准;(c) <strong>污染</strong>——公开基准易被污染(见 M5 的污染题);(d) <strong>与真实场景脱节</strong>——基准是选择题,实际是开放任务。<strong>评估实践</strong>——(a) <strong>多维度报告</strong>(不只一个总分);(b) <strong>包含'反捷径'基准</strong>(MMVP、POPE);(c) <strong>人工评估</strong>(开放式任务的黄金标准);(d) <strong>LLM-as-judge</strong>(对开放式回答打分,需校准);(e) <strong>报告评估配置</strong>(prompt、few-shot、分辨率)——否则不可比。<strong>关键陷阱</strong>——(a) <strong>'不看图也能答对'</strong>——需检查'仅给文本'的基线(若性能相当,说明模型没用到视觉);(b) <strong>选择题的猜测</strong>——随机猜测有 25% 基线;(c) <strong>答案格式敏感</strong>——解析失败会低估。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>'MMVP(CLIP 盲对)的价值'</strong>——它专门测'CLIP 看不出但人类明显'的差异(如'图中的狗朝向哪边'),故能揭示'模型是否真的在'看'图';这是评估 VLM 的关键'反捷径'工具。② <strong>'仅文本基线'是必备对照</strong>——若不对比'不看图的性能',无法判断视觉是否真的被使用;这是评估纪律。③ <strong>'能力不均衡'是常态</strong>——模型可能 OCR 强、推理弱;故需<strong>分维度报告</strong>,而非只看总分。④ <strong>'污染风险更高'</strong>——VLM 基准(MMMU 等)题目少、公开度高,且训练数据(网络图文)可能含基准题目;故需污染检测。⑤ <strong>'开放式任务需人工/LLM-judge'</strong>——选择题基准无法测'描述质量/对话能力';故需 (a) 人工评估(可靠但贵)、(b) LLM-judge(可扩展但需校准)。⑥ <strong>面试要点</strong>——被问'VLM 怎么评估',应给出'<strong>能力维度(识别/OCR/文档/图表/推理/细粒度/多图/视频)+ 对应基准 + 反捷径基准(MMVP/POPE)+ 仅文本基线对照</strong>';能指出'必须对比不看图的基线'是深度理解的标志。
⚠️ Common Interview Pitfalls
  • ✕
    只看单一基准总分
  • ✕
    不对比'仅文本'基线(无法确认视觉被使用)
🎯 Interviewer Follow-ups
  • ?
    为什么单一基准不够?
  • ?
    MMVP 测的是什么?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM6-032: VLM Training & Evaluation: 描述 VLM 的典型三阶段训练流程。📋Back to BankNext →M6-034: VLM Training & Evaluation: 解释 VLM 幻觉的类型与缓解。