← 返回总览

Leaderboard of Leaderboards (HF aggregators) low

aggregatormetaai-benchmarksleaderboard-discoverytext

2025 · https://huggingface.co/spaces/MAYA-AI/all-leaderboard · freshness: fresh 实时 HF Spaces;覆盖范围取决于查看时 HF 上托管了什么。

专家判语 Expert verdict low

“榜单的榜单,所以要深入一层挖掘一下”

人工署名(chenhao)。聚合器是否让 AgentBench 多余, 还是恰恰证明需要一层判断? 我认为,此榜单不够全面。 "按likes排序" 在哪里会主动误导一个起草 MoA 的非领域工程师? 全面的榜单很难在专一领域最权威,故只是用来初筛罢了。

— 署名 chenhao · 2026-06-16

它是什么 Agent summary 事实 · AI 整理

本条目说的是一类叫“聚合器”(aggregator)的东西,也就是把很多榜的结果汇到一起的“榜中榜”。它们都跑在 HuggingFace(简称 HF,一个放 AI 模型和工具的网站)上,只负责索引、搜索和排序别人的榜,自己不给模型打分。其中 MAYA-AI 做的“Leaderboard of Leaderboards”让你浏览、对比 HF 上托管的各种基准测试榜(benchmark,就是给 AI 出的标准考卷),可以按类别筛,也可以按点赞数(likes)或热度(trending)排序。OpenEvals 做的“every-leaderboards”则把 11 个 HF 上的 benchmark 拢到一个统一界面里看,能按模型名、规模、任务来筛;它的“find-a-leaderboard”则是一个帮你找榜的搜索工具。

可以把它们看成 AgentBench 的“对照面”:它们回答的是“有哪些榜、谁在榜上”,而且又快又自动;本仓库回答的是另一个问题——“这个榜该不该信,考了高分到底说明了什么”。要注意,它们默认按点赞和热度排序,这只反映人气,不反映质量。而且它们主要收的是 HF 上托管的榜,对学术研讨会的共享任务(shared task)、写在论文里的榜、以及各地区自己的榜,都收得不全。正是这个缺口,让本项目选择按体裁(genre)和来源一个个清点(见 docs/SOURCING.md),而不是直接靠这些聚合器的索引。

① 权威 Authority
学术/机构/引用

维护方 maintainersMAYA-AI, OpenEvals
机构数 institutions0
更新节奏 cadencelive
在线榜 online

引用

② 人气 Popularity
≠ 质量

HF Space

③ 能力 Capability
榜内排名

无榜内排名(本身不是排名榜 / 数据集)。

拿它挑模型用(MoA 选型输入)
如果你要把几个模型搭成团队,这里是从这个榜能取到的参考

能力轴 benchmark-discoveryleaderboard-comparison

模态 text   部署 apiopen-weightslocal

适合 recommended for

注意 caveats

↑ 返回顶部 · ← 返回总览