AgentBench · 主观榜单评议

市面上有一堆“AI 排行榜”在比谁的模型更强。这个站做的是另一件事:请一位专家逐个点评这些榜本身值不值得信,以及看榜时最容易踩的坑。

一分钟看懂(不需要 AI 背景)

AI 排行榜(leaderboard)有点像手机跑分:让很多 AI 模型做同一套题,按得分排名次。 麻烦在于,分高不等于真好用——题目可能早被模型“背”过,有的榜还是某家公司自己办、给自家产品打广告。

所以这里不排“谁第几名”,而是请专家回答三件事:这个榜可不可信、高分到底换来了什么真本事、 要不要照着它挑模型用。每条都标了专家的信心(高 / 中 / 低),你可以只信你愿意信的那部分。

先认识几个词

已收录 24 条 · 医疗 9 / 非医疗 15 · 只显示专家已署名的条目。

榜单类型领域能处理什么专家信心一句话判语
Artificial Analysis 2024榜中榜(聚合器)非医疗textimageaudiovideotool-usemedium透明的独立第三方:质量当粗筛、速度×价格最有用;综合分必下钻,别当能力定论。
BFCL (Berkeley Function-Calling Leaderboard) 2024在线排行榜非医疗textmedium
BRIDGE 2025在线排行榜医疗texthighHarvard, MGH等权威机构,且榜单比较新
DocVQA 2020数据集非医疗imagetextlow
EQ-Bench 2023在线排行榜非医疗textmedium
GPQA 2023数据集非医疗textmedium
HealthBench 2025随论文发布医疗texthigh
Leaderboard of Leaderboards (HF aggregators) 2025榜中榜(聚合器)非医疗textlow榜单的榜单,所以要深入一层挖掘一下
LMArena (Chatbot Arena) 2023在线排行榜非医疗textimagemedium
MedBench 2024在线排行榜医疗textimagehigh
MedHELM 2025在线排行榜医疗textmedium子榜单很经典很全面。然而,模型不太全、更新不太频繁
MEDIQA-Chat 2023 2023公开评测任务医疗textlow
MEDIQA Shared Tasks(2024–2025 系列) 2024公开评测任务医疗textimagemedium
MedQA (USMLE) 2020数据集医疗textlow太旧、很多模型在此过拟合
MLE-bench 2024随论文发布非医疗textlow
MMMU 2023在线排行榜非医疗imagetextlow
MTEB 2022在线排行榜非医疗textmedium
OmniBench 2024在线排行榜非医疗imageaudiotextlow
Open Medical-LLM Leaderboard 2024在线排行榜医疗textlow
RCQ (Real Clinical Queries) 2026随论文发布医疗texthigh
SWE-Bench Pro 2025在线排行榜非医疗textmedium
SWE-bench 2024在线排行榜非医疗textmedium
Video-MME 2024在线排行榜非医疗videotextmedium
VoiceBench 2024在线排行榜非医疗audiotextlow