返回 多模态 思维导图
中文·English
👁️ 多模态ID: multimodal-evaluation

多模态评测基准

Multimodal Eval Benchmarks
🎯核心定义
多模态评测按维度分工: MMBench 测综合能力、MMMU 测学科推理、POPE 测幻觉, 各自用不同的题制与指标。 MMBench: 30 种能力、16 大维度 (~3000 道选择题) 覆盖感知/认知/知识, 采用“只输出选项字母”的单字母约束避免开放生成的解析歧义, 指标即选择题准确率 Acc=1Ni=1N1[y^i=yi]Acc = \frac{1}{N} \sum_{i=1}^{N} \mathbb{1}[\hat{y}_i = y_i]; MMMU: 大学级多学科 (艺术/商科/科学/工程等 30+ 学科, 11.5K 题), 设计上要求“视觉信息是必要的” (不看图接近 25% 随机水平), 专门考 感知+知识+推理 的组合; POPE (Polling-based Object Probing Evaluation): 物体存在性探测——对候选物体逐一提问 “Is there a [object] in the image?”, 正样本=图中真实物体, 负样本=图中不存在的物体 (分 random / popular / adversarial 三档难度), 指标用二分类的精确率/召回率/F1: F1=2PRP+R,P=TPTP+FP,R=TPTP+FNF_1 = \frac{2 \cdot P \cdot R}{P + R}, \quad P = \frac{TP}{TP+FP}, \quad R = \frac{TP}{TP+FN} 并报告 yes-ratio (回答 Yes 的比例) 反映整体幻觉倾向。其余常用: ChartQA (数值推理)、TextVQA/DocVQA (OCR)、ScienceQA (科学图)、HallusionBench/MMHal-Bench (幻觉+推理, 后者用 LLM-as-judge 多维度打分)。
💡使用场景
面试考“评价一个多模态模型用什么基准、为什么”; 模型选型时按 能力维度 (MMBench) + 幻觉风险 (POPE) + 强推理 (MMMU) 三件套交叉验证; 发版前回归对比。
解决的核心痛点
单一大规模 VQA 基准无法区分能力 (分数高可能只因语言先验/检索捷径, 如看图不改答案); 分维度基准 (MMBench 能力矩阵) + 视觉必要题 (MMMU) + 存在性探测 (POPE 对抗负例) 三管齐下, 分别压制 答非所问、语言捷径、物体幻觉 三类测评漏洞, 让分数可归因到具体能力缺口。
🎯5 个高频面试考点 (Exam Points)
1
MMBench 的能力分类与单字母选择题设计为什么有效?
2
MMMU 与一般 VQA 基准的区别?为什么强调视觉信息是 necessary?
3
POPE 三种负样本构造策略 (random/popular/adversarial) 的区别?
4
写出 POPE 的 Precision/Recall/F1 与 yes-ratio, 各自衡量什么?
5
CHAIR / MMHal-Bench / HallusionBench 的幻觉评测方法学差异?
📖 关联深度指南:📄 vision-language-models
更新于 2026-08-12
🎯
检验攻克程度:针对「多模态评测基准」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点多模态幻觉下一个知识点VLM 投影器 MLP/Q-Former

🔗 更多 多模态 知识点卡片

语音识别 ASR音频表示Classifier-Free Guidance (CFG)CLIP 应用