MMMU low
online-leaderboardgeneralmultimodalvision-languagereasoningimagetext
2023 · https://mmmu-benchmark.github.io/ · freshness: aging 前沿 VLM 现已得分很高;MMMU-Pro 维持其区分度。仍是 tech report 里默认的多模态推理锚点。
专家判语 Expert verdict low
Human-signed (chenhao). Worth answering: "reported in every tech report" is just consensus. Cross-report frequency is weighted as popularity. MMMU 在 MoA 选型里权重很低
— 署名 chenhao · 2026-06-16
它是什么 Agent summary 事实 · AI 整理
MMMU(Yue et al., 2023;CVPR 2024)可以看作衡量“AI 同时看图读文(多模态)再做推理”能力的一份标准考卷(benchmark)。它几乎是这一类能力的默认考卷,也是本仓库里用“翻技术报告(tech report)”这个办法找到的最典型例子:几乎每份视觉-语言模型(VLM)或全模态(omni)模型的报告都会拿它来比一比,包括 Qwen3-Omni。这份考卷有 11.5K 道题,题目取自大学的考试、测验和教科书,横跨 6 个学科(Art & Design、Business、Science、Health & Medicine、Humanities & Social Science、Tech & Engineering),细分到 30 个科目、183 个子领域,配的图也有 30 种(图表、示意图、地图、乐谱、化学结构式等等)。它要求模型具备大学难度(college-level)的知识,再加上小心的推理。官方还提供一个排行榜(leaderboard)。题目被刷得太熟、分数普遍偏高之后,作者又出了更难的 MMMU-Pro 版本来拉开差距。
它几乎在每份前沿报告里都出现,这件事本身是一种“被多份报告反复引用”的信号。这比看 HuggingFace 上的点赞数、看社交媒体的热度要靠谱一些,但说到底仍然只是人气(popularity),不等于权威(authority):厂商只挑自己赢的榜来报。另外它是选择题(MCQ),所以存在模型提前见过题、靠背答案虚高的风险,而且它面向通用领域;里面虽然带了一个 Health & Medicine 子集,但这不会让它变成一份医疗专用的考卷。
① 权威 Authority
学术/机构/引用
| 维护方 maintainers | Xiang Yue / Yuansheng Ni et al. (academic collaboration) |
|---|---|
| 机构数 institutions | 0 |
| 更新节奏 cadence | irregular |
| 在线榜 online | 是 |
引用
② 人气 Popularity
≠ 质量
无显著人气数据③ 能力 Capability
榜内排名
无榜内排名(本身不是排名榜 / 数据集)。
拿它挑模型用(MoA 选型输入)
如果你要把几个模型搭成团队,这里是从这个榜能取到的参考
能力轴 multimodal-reasoningvisual-knowledgedocument-chart-understanding
模态 imagetext 部署 apiopen-weights
适合 recommended for
- 事实上的多模态推理锚点——几乎每份 VLM/omni tech report 都会对标(如 Qwen3-Omni)
- 跨多学科、多图像类型的大学水平视觉推理
注意 caveats
- 选择题 → 有记忆/走捷径风险;要更难的信号请看 MMMU-Pro
- 它在厂商 tech report 里的普遍性是 cross-report 频次(popularity),不是中立权威——厂商只报自己擅长的榜
- 含一个 Health & Medicine 子集,但整体是通用榜,不是医疗 benchmark