多模态评测按维度分工: MMBench 测综合能力、MMMU 测学科推理、POPE 测幻觉, 各自用不同的题制与指标。
MMBench: 30 种能力、16 大维度 (~3000 道选择题) 覆盖感知/认知/知识, 采用“只输出选项字母”的单字母约束避免开放生成的解析歧义, 指标即选择题准确率
Acc=N1∑i=1N1[y^i=yi];
MMMU: 大学级多学科 (艺术/商科/科学/工程等 30+ 学科, 11.5K 题), 设计上要求“视觉信息是必要的” (不看图接近 25% 随机水平), 专门考 感知+知识+推理 的组合;
POPE (Polling-based Object Probing Evaluation): 物体存在性探测——对候选物体逐一提问 “Is there a [object] in the image?”, 正样本=图中真实物体, 负样本=图中不存在的物体 (分 random / popular / adversarial 三档难度), 指标用二分类的精确率/召回率/F1:
F1=P+R2⋅P⋅R,P=TP+FPTP,R=TP+FNTP
并报告 yes-ratio (回答 Yes 的比例) 反映整体幻觉倾向。其余常用: ChartQA (数值推理)、TextVQA/DocVQA (OCR)、ScienceQA (科学图)、HallusionBench/MMHal-Bench (幻觉+推理, 后者用 LLM-as-judge 多维度打分)。