多模态推理 (Multimodal Reasoning) 指 VLM 在图表推理 (ChartQA: 读轴、取数值、算趋势)、空间推理 (方向/位置/大小/数量)、数学 (MathVista) 与科学图 (ScienceQA) 上的多步推理能力。核心机制是把文本 CoT (思维链) 迁移到视觉上下文——先描述/定位视觉证据, 再推理, 最终答案依旧由自回归目标生成:
P(y∣v,q)=t=1∏LPθ(yt∣v,q,y<t),y=[CoT 推理步骤…答案]
图表推理的关键难点是数值对齐 (从图中准确读取刻度/柱高, 需要高分辨率输入或 AnyRes 切块放大), 空间推理难点是位置信息在 patch 化时被压缩。多模态 Agent 视角: VLM 作为感知层接入工具调用与视频流 (单图 → 多图 → 视频流), 把视觉状态转成可执行指令, 成为 GUI/具身/视频 Agent 的“眼睛”。