返回 多模态 思维导图
中文·English
👁️ 多模态ID: vlm-capabilities

VLM 能力图谱

VLM Capabilities
🎯核心定义
VLM 能力图谱 (VLM Capabilities) 指视觉语言模型统一的自回归生成能力集合: 图像描述 (captioning)、视觉问答 (VQA)、OCR (TextVQA/DocVQA)、视觉 grounding (指代定位)、多图比较、图表与视频理解。本质是所有任务都被转写为“视觉 token + 文本 prompt → 文本 token 序列”的自回归生成: pθ(yv,q)=t=1Lpθ(ytv,q,y<t)p_\theta(y \mid v, q) = \prod_{t=1}^{L} p_\theta(y_t \mid v, q, y_{<t}) 统一目标意味着同一条 Masked CE 损失训练出全部能力 (任务间迁移 + 共享世界知识)。grounding 是特例: 模型输出坐标 token, 把连续框 b^R4\hat{b} \in \mathbb{R}^4 离散化为网格坐标 (如 0–1000 量化) 与其他文本 token 混合解码。 能力侧的典型失败: 文本幻觉 (text hallucination, 模型按语言先验虚构图像中不存在的语义内容) 与 OCR 幻觉 (OCR hallucination, 识别出“文字”但内容与图实际文字不符), 两者成因都在语言先验与数据偏置。
💡使用场景
面试考察“VLM 到底会什么、怎么统一实现”, 以及判断新模型能力边界 (能 OCR 不代表能数数/能 grounding 不代表能精确空间推理); 多模态 Agent 选型也按此能力清单对照。
解决的核心痛点
任务专模时代 (每能力一个模型) 数据利用低、无法跨任务共享视觉-语言知识; 统一自回归目标使一套权重 + 一条损失覆盖全部能力, 视觉推理能力随 LLM 解冻与 SFT 涌现, 并让 grounding/OCR 等能力可以直接复用 LLM 的指令跟随与上下文学习。
🎯5 个高频面试考点 (Exam Points)
1
为什么 VLM 的 caption/VQA/OCR/grounding 都归结为自回归 token 生成?写出统一目标?
2
视觉 grounding 如何实现?连续坐标框如何离散化为 token?
3
文本幻觉与 OCR 幻觉的区别?各自的成因与例子?
4
VLM 能力边界: OCR / 图表 / 视频各需要什么数据与输入表示支撑?
5
多图比较与视频理解在输入表示上的差异?
📖 关联深度指南:📄 vision-language-models
更新于 2026-08-12
🎯
检验攻克程度:针对「VLM 能力图谱」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点图文交错训练数据下一个知识点多模态推理与 Agent

🔗 更多 多模态 知识点卡片

语音识别 ASR音频表示Classifier-Free Guidance (CFG)CLIP 应用