Leaderboard of Leaderboards (HF aggregators) low
aggregatormetaai-benchmarksleaderboard-discoverytext
2025 · https://huggingface.co/spaces/MAYA-AI/all-leaderboard · freshness: fresh 实时 HF Spaces;覆盖范围取决于查看时 HF 上托管了什么。
专家判语 Expert verdict low
“榜单的榜单,所以要深入一层挖掘一下”
人工署名(chenhao)。聚合器是否让 AgentBench 多余, 还是恰恰证明需要一层判断? 我认为,此榜单不够全面。 "按likes排序" 在哪里会主动误导一个起草 MoA 的非领域工程师? 全面的榜单很难在专一领域最权威,故只是用来初筛罢了。
— 署名 chenhao · 2026-06-16
它是什么 Agent summary 事实 · AI 整理
本条目说的是一类叫“聚合器”(aggregator)的东西,也就是把很多榜的结果汇到一起的“榜中榜”。它们都跑在 HuggingFace(简称 HF,一个放 AI 模型和工具的网站)上,只负责索引、搜索和排序别人的榜,自己不给模型打分。其中 MAYA-AI 做的“Leaderboard of Leaderboards”让你浏览、对比 HF 上托管的各种基准测试榜(benchmark,就是给 AI 出的标准考卷),可以按类别筛,也可以按点赞数(likes)或热度(trending)排序。OpenEvals 做的“every-leaderboards”则把 11 个 HF 上的 benchmark 拢到一个统一界面里看,能按模型名、规模、任务来筛;它的“find-a-leaderboard”则是一个帮你找榜的搜索工具。
可以把它们看成 AgentBench 的“对照面”:它们回答的是“有哪些榜、谁在榜上”,而且又快又自动;本仓库回答的是另一个问题——“这个榜该不该信,考了高分到底说明了什么”。要注意,它们默认按点赞和热度排序,这只反映人气,不反映质量。而且它们主要收的是 HF 上托管的榜,对学术研讨会的共享任务(shared task)、写在论文里的榜、以及各地区自己的榜,都收得不全。正是这个缺口,让本项目选择按体裁(genre)和来源一个个清点(见 docs/SOURCING.md),而不是直接靠这些聚合器的索引。
① 权威 Authority
学术/机构/引用
| 维护方 maintainers | MAYA-AI, OpenEvals |
|---|---|
| 机构数 institutions | 0 |
| 更新节奏 cadence | live |
| 在线榜 online | 是 |
引用
- Leaderboard of Leaderboards (HuggingFace Space, MAYA-AI) · 2026-06-16
- Official Benchmarks Leaderboard 2026 — every-leaderboards (OpenEvals) · 2026-06-16
- Find a leaderboard (OpenEvals) · 2026-06-16
② 人气 Popularity
≠ 质量
HF Space③ 能力 Capability
榜内排名
无榜内排名(本身不是排名榜 / 数据集)。
拿它挑模型用(MoA 选型输入)
如果你要把几个模型搭成团队,这里是从这个榜能取到的参考
能力轴 benchmark-discoveryleaderboard-comparison
模态 text 部署 apiopen-weightslocal
适合 recommended for
- 深入之前,先找出某能力到底有哪些 leaderboard 存在
- 本仓库的 OBJECTIVE 对照面——它们列榜,我们评榜
注意 caveats
- 按 likes / trending 排序——是 POPULARITY,不是质量(正是 AgentBench 要对抗的陷阱)
- 主要索引 HF 托管的榜;漏掉 shared task、论文内置榜与区域榜(见 docs/SOURCING.md)
- 没有专家判断:回答‘谁在榜上',从不回答’该不该信这个榜‘