Open Medical-LLM Leaderboard low
online-leaderboardmedicalmedical-QAtext
2024 · https://huggingface.co/spaces/openlifescienceai/open_medical_llm_leaderboard · freshness: aging QA 背诵类任务(MultiMedQA 式)已被前沿模型大幅饱和;区分力正在消退。
专家判语 Expert verdict low
人工署名(chenhao)。值得回答: 既然已饱和,这个榜还值得引用吗——作为下限、作为负向过滤, 还是干脆不用? 我认为可以作为下限、若后续更新太慢则可不用。
— 署名 chenhao · 2026-06-16
它是什么 Agent summary 事实 · AI 整理
Open Medical-LLM Leaderboard 是一个排行榜,由 Open Life Science AI 和 Hugging Face(一个公开托管 AI 模型的平台)在 2024 年做出来,挂在 HuggingFace Space 上(就是 Hugging Face 上的一个在线小应用页面)。它的做法是拿几套医学考卷来考各家模型,再按答对率排名:这些考卷包括 MedQA(题目仿照美国执业医师资格考试 USMLE)、PubMedQA、MedMCQA,以及 MMLU 里的医学子集。任何人都可以把自己的模型提交上来,页面还能按模型类型、精度、规模来筛选。想给那些权重公开、可以自己部署的(open-weights)医学模型做一次初筛,这是最方便的入口。
它的短板是结构性的。这些考卷大多是选择题(MCQ),考的是知识背诵,属于所谓的 MultiMedQA 这一类。如今顶尖模型基本都答得上来,所以这个榜已经饱和(saturated),也就是高分模型扎堆挤在天花板附近、分不出高下,对模型在真实临床里怎么表现、安不安全、会不会好好沟通,几乎说明不了什么。建议把它当成一个快速判断知识下限的工具,而不是决定要不要部署某个模型的依据。
① 权威 Authority
学术/机构/引用
| 维护方 maintainers | Open Life Science AI, Hugging Face |
|---|---|
| 机构数 institutions | 0 |
| 更新节奏 cadence | irregular |
| 在线榜 online | 是 |
引用
② 人气 Popularity
≠ 质量
HF Space③ 能力 Capability
榜内排名
无榜内排名(本身不是排名榜 / 数据集)。
拿它挑模型用(MoA 选型输入)
如果你要把几个模型搭成团队,这里是从这个榜能取到的参考
能力轴 medical-knowledge-QA
模态 text 部署 open-weights
适合 recommended for
- 在深入评测前,对开源模型做一次快速的医疗知识筛查
- 对比小型/量化的开源模型——此时考试-QA 仍有区分度
注意 caveats
- 以选择题知识背诵为主——对真实临床行为或安全信号很弱
- MultiMedQA 式任务正在饱和;顶部得分扎堆贴近天花板