← 返回总览

OmniBench low

online-leaderboardgeneralmultimodalomniaudio-visualimageaudiotext

2024 · https://m-a-p.ai/OmniBench/ · freshness: fresh 2024 年的三模态基准;仍是 omni-modal 整合的参考,经 Qwen3-Omni 报告浮现。

专家判语 Expert verdict low

人工署名(chenhao)。值得回答: 三模态整合是不是一个独立的 MoA 选型维度, 还是被各单模态分数所涵盖? 只有在世界模型、环境交互中需要被考虑。 n=1,142 是否足以给权重,还是只能作为方向性信号? 只能作为启发式思考

— 署名 chenhao · 2026-06-16

它是什么 Agent summary 事实 · AI 整理

OmniBench 是一份给 AI 出的标准考卷(benchmark),由 M-A-P(multimodal-art-projection)团队在 2024 年做出来。它要考的是 tri-modal,也就是同时给图、音、文三种输入(image、audio、text),看模型能不能一起用上。Qwen3-Omni 的技术报告里也用了它当音视频测试,我们正是顺着这类报告发现它的。

整份卷子有 1,142 道人工标注的问答对。题目特意设计成:要答对,就得把三种输入整合起来推理,只看其中一种(单模态)、想走捷径,就会答错。音频也分了三类:语音(speech)、环境声响(sound events)、音乐(music)。所以它能测出一件大多数考卷测不到的事:模型是不是真把多种模态融到一起用,而不是分头各考一种单模态本事。

它也有短板。一是题量小,只有 1,142 题,样本太少,统计上说服力有限。二是它能被人注意到,主要是因为多家厂商的 omni 模型报告里反复提到它(cross-report 频次),这只能算人气,不等于中立的权威背书。把它当成一个聚焦的检验角度还行:用来看模型到底有没有真正融合多模态。

① 权威 Authority
学术/机构/引用

维护方 maintainersYizhi Li / Ge Zhang et al. (M-A-P / multimodal-art-projection)
机构数 institutions0
更新节奏 cadenceirregular
在线榜 online

引用

② 人气 Popularity
≠ 质量

无显著人气数据

③ 能力 Capability
榜内排名

无榜内排名(本身不是排名榜 / 数据集)。

拿它挑模型用(MoA 选型输入)
如果你要把几个模型搭成团队,这里是从这个榜能取到的参考

能力轴 tri-modal-reasoningaudio-visual-understanding

模态 imageaudiotext   部署 apiopen-weights

适合 recommended for

注意 caveats

↑ 返回顶部 · ← 返回总览