返回 多模态 思维导图
中文·English
👁️ 多模态ID: multimodal-hallucination

多模态幻觉

Multimodal Hallucination
🎯核心定义
多模态幻觉 (Multimodal Hallucination) 指 VLM 生成与图像事实不符的内容, 常见两类: 物体幻觉 (object hallucination, 输出图中不存在的物体) 与属性幻觉 (attribute hallucination, 颜色/数量/位置等属性错误)。成因可归为三股力量: (1) 语言先验主导 (text prior dominance): 生成时视觉证据弱于 LLM 文本统计先验, pθ(ytx<t,v)p_\theta(y_t \mid x_{<t}, v)vv 的贡献不足, 模型用语言习惯“脑补”; (2) 数据共现偏置: caption 中物体高频共现 (如 COCO 里 person 与 surfboard 常同时出现), 模型学到共现统计而非“图中是否存在”; (3) 训练目标与解码放大: Masked CE 只监督文本 token、视觉 token 无梯度监督, 视觉信号训练不足; 自回归贪心/采样放大高熵幻觉 token。 解码层缓解的代表是视觉对比解码 (VCD), 用失真图 vv' (如高斯模糊) 的 logit 抵消语言先验: q(yt)=softmax((1+α)logpθ(ytx<t,v)αlogpθ(ytx<t,v))q(y_t) = \text{softmax}\left( (1+\alpha)\, \log p_\theta(y_t \mid x_{<t}, v) - \alpha\, \log p_\theta(y_t \mid x_{<t}, v') \right) α\alpha 控制先验消除强度 (常取 0.1–1); OPERA 则对“重复解码无新注意力”的过度采样行为做惩罚。评估用 POPE 探测与 CHAIR 词级指标: CHAIRS=幻觉物体全部提及物体CHAIR_S = \frac{|\text{幻觉物体}|}{\text{全部提及物体}}
💡使用场景
面试必问“幻觉成因与缓解”; 实际部署前必须做幻觉审计 (医疗/文档场景不可接受); 对齐阶段数据构造 (见 multimodal-dpo 卡)。
解决的核心痛点
幻觉让 VLM 在事实敏感场景不可用, 且难以靠增大模型规模根治 (先验越强越容易脑补); 从 数据去偏 (平衡负样本/硬负例)、对齐 (MMDPO/RLHF-V 用 POPE 负例压制)、解码干预 (VCD/OPERA) 三层面系统性缓解, 并给出 POPE/CHAIR 可量化评估——各层面互补: 数据改先验、对齐改偏好、解码改推理时行为。
🎯5 个高频面试考点 (Exam Points)
1
物体幻觉的三大成因 (文本先验/共现偏置/训练目标) 逐一解释?
2
写出 VCD 视觉对比解码公式并解释为什么能缓解幻觉?
3
POPE 评估如何构造正负样本?CHAIR 指标怎么算?
4
数据层面如何缓解物体幻觉 (共现偏置与硬负例)?
5
贪心/采样解码如何放大幻觉?OPERA 的原理?
📖 关联深度指南:📄 vision-language-models
更新于 2026-08-12
🎯
检验攻克程度:针对「多模态幻觉」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点多模态推理与 Agent下一个知识点多模态评测基准

🔗 更多 多模态 知识点卡片

语音识别 ASR音频表示Classifier-Free Guidance (CFG)CLIP 应用