多模态幻觉 (Multimodal Hallucination) 指 VLM 生成与图像事实不符的内容, 常见两类: 物体幻觉 (object hallucination, 输出图中不存在的物体) 与属性幻觉 (attribute hallucination, 颜色/数量/位置等属性错误)。成因可归为三股力量:
(1) 语言先验主导 (text prior dominance): 生成时视觉证据弱于 LLM 文本统计先验,
pθ(yt∣x<t,v) 中
v 的贡献不足, 模型用语言习惯“脑补”;
(2) 数据共现偏置: caption 中物体高频共现 (如 COCO 里 person 与 surfboard 常同时出现), 模型学到共现统计而非“图中是否存在”;
(3) 训练目标与解码放大: Masked CE 只监督文本 token、视觉 token 无梯度监督, 视觉信号训练不足; 自回归贪心/采样放大高熵幻觉 token。
解码层缓解的代表是视觉对比解码 (VCD), 用失真图
v′ (如高斯模糊) 的 logit 抵消语言先验:
q(yt)=softmax((1+α)logpθ(yt∣x<t,v)−αlogpθ(yt∣x<t,v′))
α 控制先验消除强度 (常取 0.1–1); OPERA 则对“重复解码无新注意力”的过度采样行为做惩罚。评估用 POPE 探测与 CHAIR 词级指标:
CHAIRS=全部提及物体∣幻觉物体∣。