返回 多模态 思维导图
中文·English
👁️ 多模态ID: multimodal-reasoning

多模态推理与 Agent

Multimodal Reasoning & Agents
🎯核心定义
多模态推理 (Multimodal Reasoning) 指 VLM 在图表推理 (ChartQA: 读轴、取数值、算趋势)、空间推理 (方向/位置/大小/数量)、数学 (MathVista) 与科学图 (ScienceQA) 上的多步推理能力。核心机制是把文本 CoT (思维链) 迁移到视觉上下文——先描述/定位视觉证据, 再推理, 最终答案依旧由自回归目标生成: P(yv,q)=t=1LPθ(ytv,q,y<t),y=[CoT 推理步骤答案]P(y \mid v, q) = \prod_{t=1}^{L} P_\theta(y_t \mid v, q, y_{<t}), \quad y = [\text{CoT 推理步骤} \ldots \text{答案}] 图表推理的关键难点是数值对齐 (从图中准确读取刻度/柱高, 需要高分辨率输入或 AnyRes 切块放大), 空间推理难点是位置信息在 patch 化时被压缩。多模态 Agent 视角: VLM 作为感知层接入工具调用与视频流 (单图 → 多图 → 视频流), 把视觉状态转成可执行指令, 成为 GUI/具身/视频 Agent 的“眼睛”。
💡使用场景
面试考“VLM 会不会推理、哪里会崩、怎么改进”; 选型多模态 Agent (模型能否读图表报表、看视频流、调工具); 评估 MathVista/ChartQA 类榜单的实际价值。
解决的核心痛点
早期 VLM 只做感知 (描述/识别) 不做推理, 面对图表数学任务近乎随机; 通过 高分辨率/放大输入 + 图文交错预训练 (多图与长上下文推理信号) + CoT 指令微调 让推理链显式出现, 并把推理能力复用到 Agent 场景——错误模式高度集中在 数值读取错误、视觉证据与推理脱节、空间关系误判, 改进方向 = 分辨率/数据/解码三个层面。
🎯5 个高频面试考点 (Exam Points)
1
多模态 CoT 与纯文本 CoT 的差异?图表推理的核心难点?
2
VLM 作为 Agent 感知层的三种输入形态 (单图/多图/视频流) 及各自处理?
3
MathVista / ChartQA 上 VLM 常见的错误类型 (数值读取/证据脱节)?
4
空间推理为什么难?如何改进?
5
多模态推理能力主要来自预训练、SFT 还是解码策略?证据是什么?
📖 关联深度指南:📄 vision-language-models
更新于 2026-08-12
🎯
检验攻克程度:针对「多模态推理与 Agent」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点VLM 能力图谱下一个知识点多模态幻觉

🔗 更多 多模态 知识点卡片

语音识别 ASR音频表示Classifier-Free Guidance (CFG)CLIP 应用