VLM 能力图谱 (VLM Capabilities) 指视觉语言模型统一的自回归生成能力集合: 图像描述 (captioning)、视觉问答 (VQA)、OCR (TextVQA/DocVQA)、视觉 grounding (指代定位)、多图比较、图表与视频理解。本质是所有任务都被转写为“视觉 token + 文本 prompt → 文本 token 序列”的自回归生成:
pθ(y∣v,q)=t=1∏Lpθ(yt∣v,q,y<t)
统一目标意味着同一条 Masked CE 损失训练出全部能力 (任务间迁移 + 共享世界知识)。grounding 是特例: 模型输出坐标 token, 把连续框
b^∈R4 离散化为网格坐标 (如 0–1000 量化) 与其他文本 token 混合解码。
能力侧的典型失败: 文本幻觉 (text hallucination, 模型按语言先验虚构图像中不存在的语义内容) 与 OCR 幻觉 (OCR hallucination, 识别出“文字”但内容与图实际文字不符), 两者成因都在语言先验与数据偏置。