M6-034M6: Multimodal & Generative ModelsVLM Training & EvaluationMedium
Mastery:

VLM Training & Evaluation: 解释 VLM 幻觉的类型与缓解。

📐 Mathematical Definition
hallucination types: existence,attribute,relation,OCR;fix: fine-grained pref.\text{hallucination types}:\ \text{existence},\text{attribute},\text{relation},\text{OCR};\qquad \text{fix}:\ \text{fine-grained pref.}
⚡ Executive Summary
Core Concept: 类型:物体存在性、属性、关系、OCR;缓解:细粒度偏好数据、负样本、RLHF、高分辨率、证据约束。

📌 Key Takeaways

  • •
    类型:描述不存在的物体、属性错误、关系错误、OCR 错误
  • •
    成因:语言先验过强(不看图也答)、训练数据偏差、分辨率不足
  • •
    缓解:细粒度偏好数据、负样本训练、RLHF、高分辨率、要求引用证据

📐 Mathematical Derivations

数学机理:<strong>VLM 幻觉的类型</strong>——(a) <strong>存在性幻觉(existence)</strong>——描述了图中<strong>不存在</strong>的物体(最常见);(b) <strong>属性幻觉(attribute)</strong>——物体的颜色/形状/数量错误;(c) <strong>关系幻觉(relation)</strong>——空间/动作关系错误(如'猫在桌上'实为'桌上有猫的照片');(d) <strong>OCR 幻觉</strong>——读出图中没有的文字(或读错);(e) <strong>事实性幻觉</strong>——对图中内容的解释错误(依赖外部知识时)。<strong>成因</strong>——(1) <strong>语言先验主导(language prior dominance)</strong>——这是 VLM 幻觉的<strong>核心成因</strong>:LLM 的语言先验太强,导致模型'不看图也能生成流畅描述'(如看到'厨房'就描述'有锅有灶');当视觉信息与语言先验冲突时,模型可能<strong>忽略视觉</strong>而跟随语言。(2) <strong>训练数据偏差</strong>——图文对数据的分布偏差(如'草地'常与'狗'共现);(3) <strong>分辨率不足</strong>——细节看不清时,模型用先验'补全';(4) <strong>训练目标</strong>——'生成流畅描述'的损失不惩罚'编造'(只要流畅);(5) <strong>缺乏'不确定'的表达</strong>——模型不学会说'我看不清'。<strong>缓解手段</strong>——(1) <strong>细粒度偏好数据(关键)</strong>——<strong>RLHF-V</strong> 的做法:让人类对模型回答的<strong>每个句子</strong>标注'是否被图像支持',用这些<strong>细粒度偏好</strong>做 DPO;这比'整体偏好'更有效(因为能精确定位幻觉句子)。(2) <strong>负样本训练</strong>——构造'含幻觉的描述'作为负样本,训练模型区分;(3) <strong>RLHF / DPO</strong>——用偏好优化减少幻觉(VLM 的阶段三);(4) <strong>高分辨率</strong>——减少'看不清导致编造'(见动态分辨率);(5) <strong>证据约束</strong>——要求模型'先指出图中的证据再回答'(类似文本的 CoT + 引用);(6) <strong>不确定性表达</strong>——训练模型说'图中未显示';(7) <strong>后验校验</strong>——用另一个模型(或同一模型的'仅文本'分支)检查回答是否被图像支持。<strong>评估</strong>——(a) <strong>POPE</strong>(问'图中是否有 X',测存在性幻觉);(b) <strong>MMHal-Bench</strong>;(c) <strong>AMBER</strong>;(d) 人工评估(最可靠)。<strong>为什么 VLM 幻觉比 LLM 严重</strong>——因为 (a) 视觉信息与语言先验的<strong>冲突</strong>(LLM 没有这个冲突);(b) 视觉输入'更难验证'(用户不易察觉模型没看图);(c) 训练目标更偏向'流畅'。<strong>实证</strong>——RLHF-V 报告用 1.4k 条细粒度偏好数据即可显著减少幻觉(数据效率极高);说明'幻觉主要源于训练目标未惩罚它'。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>'语言先验主导'是 VLM 幻觉的核心机制</strong>——面试中能指出这一点(而非泛泛说'训练数据不好')是深度理解的标志;它解释了'为什么模型不看图也能说得头头是道'。② <strong>'细粒度偏好数据高效'</strong>——RLHF-V 用 1.4k 条就显著改善,说明'精准的偏好信号'比'海量数据'更有效;这是 VLM 对齐的重要经验。③ <strong>'高分辨率减少幻觉'</strong>——因为很多幻觉源于'看不清'(模型用先验补全);故高分辨率是基础改进。④ <strong>'评估必须用 POPE 类基准'</strong>——因为它直接测'存在性幻觉'(最严重、最常见);仅用 MMBench 等选择题基准可能掩盖幻觉问题。⑤ <strong>'要求证据的 prompt 有效'</strong>——让模型'先描述看到什么再回答'可显著减少幻觉(因为它迫使模型依赖视觉);这与文本的'引用要求'同理。⑥ <strong>面试要点</strong>——被问'VLM 幻觉怎么办',应给出'<strong>类型(存在/属性/关系/OCR)+ 核心成因(语言先验主导)+ 缓解(细粒度偏好数据 / RLHF / 高分辨率 / 证据约束 / 不确定性表达)+ 评估(POPE)</strong>';能指出'语言先验主导'与'细粒度偏好高效'是深度理解的标志。
⚠️ Common Interview Pitfalls
  • ✕
    只看流畅度判断 VLM 回答质量(幻觉可能很流畅)
  • ✕
    不做 POPE 类幻觉评估
🎯 Interviewer Follow-ups
  • ?
    为什么 VLM 幻觉比 LLM 更严重?
  • ?
    什么是'语言先验主导'?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM6-033: VLM Training & Evaluation: 列举 VLM 的主要评估基准与能力维度。📋Back to BankNext →M6-035: VLM Training & Evaluation: 解释 grounding 能力与它的训练数据。