← 返回总览

MMMU low

online-leaderboardgeneralmultimodalvision-languagereasoningimagetext

2023 · https://mmmu-benchmark.github.io/ · freshness: aging 前沿 VLM 现已得分很高;MMMU-Pro 维持其区分度。仍是 tech report 里默认的多模态推理锚点。

专家判语 Expert verdict low

Human-signed (chenhao). Worth answering: "reported in every tech report" is just consensus. Cross-report frequency is weighted as popularity. MMMU 在 MoA 选型里权重很低

— 署名 chenhao · 2026-06-16

它是什么 Agent summary 事实 · AI 整理

MMMU(Yue et al., 2023;CVPR 2024)可以看作衡量“AI 同时看图读文(多模态)再做推理”能力的一份标准考卷(benchmark)。它几乎是这一类能力的默认考卷,也是本仓库里用“翻技术报告(tech report)”这个办法找到的最典型例子:几乎每份视觉-语言模型(VLM)或全模态(omni)模型的报告都会拿它来比一比,包括 Qwen3-Omni。这份考卷有 11.5K 道题,题目取自大学的考试、测验和教科书,横跨 6 个学科(Art & Design、Business、Science、Health & Medicine、Humanities & Social Science、Tech & Engineering),细分到 30 个科目、183 个子领域,配的图也有 30 种(图表、示意图、地图、乐谱、化学结构式等等)。它要求模型具备大学难度(college-level)的知识,再加上小心的推理。官方还提供一个排行榜(leaderboard)。题目被刷得太熟、分数普遍偏高之后,作者又出了更难的 MMMU-Pro 版本来拉开差距。

它几乎在每份前沿报告里都出现,这件事本身是一种“被多份报告反复引用”的信号。这比看 HuggingFace 上的点赞数、看社交媒体的热度要靠谱一些,但说到底仍然只是人气(popularity),不等于权威(authority):厂商只挑自己赢的榜来报。另外它是选择题(MCQ),所以存在模型提前见过题、靠背答案虚高的风险,而且它面向通用领域;里面虽然带了一个 Health & Medicine 子集,但这不会让它变成一份医疗专用的考卷。

① 权威 Authority
学术/机构/引用

维护方 maintainersXiang Yue / Yuansheng Ni et al. (academic collaboration)
机构数 institutions0
更新节奏 cadenceirregular
在线榜 online

引用

② 人气 Popularity
≠ 质量

无显著人气数据

③ 能力 Capability
榜内排名

无榜内排名(本身不是排名榜 / 数据集)。

拿它挑模型用(MoA 选型输入)
如果你要把几个模型搭成团队,这里是从这个榜能取到的参考

能力轴 multimodal-reasoningvisual-knowledgedocument-chart-understanding

模态 imagetext   部署 apiopen-weights

适合 recommended for

注意 caveats

↑ 返回顶部 · ← 返回总览