Video-MME medium
online-leaderboardgeneralvideomultimodalvideotext
2024 · https://video-mme.github.io/ · freshness: fresh 实时 leaderboard;在视频-LLM 评测中被广泛引用。顶部前沿模型攀升中(Gemini 级约 80 多分)。
专家判语 Expert verdict medium
人工署名(chenhao)。值得回答: 长视频时序推理是否值得一个独立的 MoA 维度? 不值得,因为现在和人类专家差距过大,整体业界还不成熟。 "分数依赖字幕/音频" 在多大程度上削弱了跨模型可比性? 我认为影响比较大。
— 署名 chenhao · 2026-06-16
它是什么 Agent summary 事实 · AI 整理
Video-MME(Fu et al., 2024;CVPR 2025;MME-Benchmarks)是一套给 AI 出的标准考卷(benchmark),专门考能看视频并读文字的大模型(多模态 MLLM)。它自称是面向视频的首个综合评测基准,也是我们在各家厂商技术报告里翻到、而不是靠搜索名字找到的视频考卷之一。整套题目用了 900 个人工挑选、专家标注的视频,合计 254 小时,出成 2,700 道问答题,覆盖 6 个领域、30 个子领域。
它有个特别之处:视频时长从 11 秒到 1 小时都有,按短、中、长(short/medium/long video)分级。要答对长视频的题,模型得跟着画面理清前后发生了什么(时序推理),不能只看几帧蒙一下。喂给模型的也不只是画面帧,还配了字幕和音频。
现在这套题被很多论文当参考,GPT-4.1 就把它当成衡量“看长视频”能力的行业标准。
它的局限也清楚:题目是选择题(MCQ),给不给字幕、音频两种条件下分数会变;而且只考通用视频理解,不针对某个具体领域。如果要把多个模型组队、各管一块来用(MoA),它适合用来挑视频理解、长上下文这一块的模型。
① 权威 Authority
学术/机构/引用
| 维护方 maintainers | Chaoyou Fu et al. (MME-Benchmarks) |
|---|---|
| 机构数 institutions | 0 |
| 更新节奏 cadence | irregular |
| 在线榜 online | 是 |
引用
② 人气 Popularity
≠ 质量
无显著人气数据③ 能力 Capability
榜内排名
无榜内排名(本身不是排名榜 / 数据集)。
拿它挑模型用(MoA 选型输入)
如果你要把几个模型搭成团队,这里是从这个榜能取到的参考
能力轴 video-understandinglong-context-multimodaltemporal-reasoning
模态 videotext 部署 apiopen-weights
适合 recommended for
- 对比视频 LLM,含长视频(可达 1 小时)的时序推理
- 一个事实上的行业标准视频榜(被 GPT-4.1 当作参考)
注意 caveats
- 选择题形式;分数随是否提供字幕/音频而变
- 通用视频理解——不针对具体领域