M6-036M6: Multimodal & Generative ModelsVLM Training & EvaluationHard
Mastery:

VLM Training & Evaluation: 解释 VLM 在多图与视频上的评估难点。

📐 Mathematical Definition
multi-image: cross-image reasoning;video: temporal, causal, long-horizon\text{multi-image}:\ \text{cross-image reasoning};\qquad \text{video}:\ \text{temporal},\ \text{causal},\ \text{long-horizon}
⚡ Executive Summary
Core Concept: 多图需评'跨图比较/关系';视频需评'时序/因果/长程';两者都受 token 预算与采样策略影响。

📌 Key Takeaways

  • •
    多图:跨图比较、指代('图 2 中的物体')、图像数量泛化
  • •
    视频:时序理解、动作识别、因果推理、长程依赖
  • •
    难点:token 预算(帧/图多了放不下)、采样策略影响结果

📐 Mathematical Derivations

数学机理:<strong>多图评估的难点</strong>——(a) <strong>跨图推理</strong>——需理解'图 1 与图 2 的关系'(比较、变化、相同/不同);这类题目要求模型<strong>同时保持多图的信息</strong>(而非只看一张);(b) <strong>指代清晰性</strong>——'第二张图里的物体'需要模型正确索引图像;故需<strong>图像索引机制</strong>(如 <code><image_2></code> 标记);(c) <strong>图像数量泛化</strong>——训练时 2 张图、推理时 8 张,性能可能显著下降(因为注意力分布与 token 预算变化);(d) <strong>token 预算</strong>——M 张图 × N token 易超上下文,故需压缩(但压缩可能损害跨图细节);(e) <strong>基准稀缺</strong>——多图基准较少(NLVR2、部分 MMMU 题、以及专门的'多图 QA');评估覆盖不足。<strong>视频评估的难点</strong>——(a) <strong>时序理解</strong>——'先发生什么'(动作顺序)、'持续多久'(时长);需模型理解<strong>时间维</strong>;(b) <strong>因果推理</strong>——'为什么这个动作导致那个结果';(c) <strong>长程依赖</strong>——长视频(分钟级)的关键信息可能相隔很远(如'开头的人物在结尾出现');(d) <strong>采样策略的影响</strong>——视频需<strong>抽帧</strong>(帧数有限);抽帧方式(均匀/关键帧/密集)显著影响结果——<strong>同一模型不同抽帧策略的分数差异可能很大</strong>,导致结果不可比;(e) <strong>时序分辨率与 token 预算的矛盾</strong>——帧数多则 token 多(成本高);帧数少则漏掉关键动作;(f) <strong>基准的局限</strong>——现有视频基准多测'单帧可答'的问题(如'视频里有什么'),而非真正的时序推理;(g) <strong>评估成本</strong>——视频的 token 数远大于图像(数十帧 × 每帧数百 token),评估成本高。<strong>评估实践</strong>——(a) <strong>多图</strong>——用'指代明确'的题目(避免歧义)、测'图像数量泛化'(不同数量)、报告 token 预算;(b) <strong>视频</strong>——<strong>固定抽帧策略</strong>(否则不可比)、报告帧数与采样方式、区分'单帧可答'与'需时序'的题目(如 TempCompass 的时序子集)、用专门基准(Video-MME、MVBench、TempCompass);(c) <strong>两者都需</strong>——报告'因预算不足的失败'、与'单图/单帧基线'对比。<strong>改进方向</strong>——(a) <strong>时序位置编码</strong>(3D RoPE 的时间维);(b) <strong>稀疏/分层采样</strong>(先粗筛关键帧、再密集处理);(c) <strong>视频摘要</strong>(把长视频压成关键帧 + 文本摘要);(d) <strong>专门的时序注意力设计</strong>(时空分离注意力)。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>'抽帧策略影响结果'是视频评估的关键问题</strong>——不同论文用不同抽帧方式,导致分数<strong>不可比</strong>;故<strong>必须报告抽帧配置</strong>(帧数、采样方式)。② <strong>'单帧可答'的问题掩盖时序能力</strong>——很多视频基准的问题用单帧就能答(如'视频里有什么');故需 (a) 时序专门子集、(b) 与'单帧基线'对比。③ <strong>'图像数量泛化'是多图的常见失败</strong>——训练时数量固定会导致推理时数量变化即失效;故需训练时随机化数量。④ <strong>'token 预算是最硬的约束'</strong>——多图/视频的 token 需求远超图像;故需 (a) 固定 K 压缩、(b) 稀疏采样、(c) 分层处理。⑤ <strong>'指代明确性'影响多图评估的公平性</strong>——若题目中的'那张图'指代不明,则模型答错不是能力问题;故基准设计需明确索引。⑥ <strong>面试要点</strong>——被问'多图/视频怎么评估',应给出'<strong>多图(跨图推理/指代/数量泛化/预算)+ 视频(时序/因果/长程/抽帧策略)</strong>'与'<strong>必须报告抽帧配置、区分单帧可答与时序题</strong>';能指出'抽帧策略导致结果不可比'是深度理解的标志。
⚠️ Common Interview Pitfalls
  • ✕
    不报告抽帧策略(结果不可比)
  • ✕
    用'单帧可答'的题评估时序能力
🎯 Interviewer Follow-ups
  • ?
    视频的'时序'如何评?
  • ?
    为什么视频评估结果不可比?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM6-035: VLM Training & Evaluation: 解释 grounding 能力与它的训练数据。📋Back to BankNext →M6-037: VLM Training & Evaluation: 解释 VLM 的效率优化方向。