← 返回总览

Open Medical-LLM Leaderboard low

online-leaderboardmedicalmedical-QAtext

2024 · https://huggingface.co/spaces/openlifescienceai/open_medical_llm_leaderboard · freshness: aging QA 背诵类任务(MultiMedQA 式)已被前沿模型大幅饱和;区分力正在消退。

专家判语 Expert verdict low

人工署名(chenhao)。值得回答: 既然已饱和,这个榜还值得引用吗——作为下限、作为负向过滤, 还是干脆不用? 我认为可以作为下限、若后续更新太慢则可不用。

— 署名 chenhao · 2026-06-16

它是什么 Agent summary 事实 · AI 整理

Open Medical-LLM Leaderboard 是一个排行榜,由 Open Life Science AI 和 Hugging Face(一个公开托管 AI 模型的平台)在 2024 年做出来,挂在 HuggingFace Space 上(就是 Hugging Face 上的一个在线小应用页面)。它的做法是拿几套医学考卷来考各家模型,再按答对率排名:这些考卷包括 MedQA(题目仿照美国执业医师资格考试 USMLE)、PubMedQA、MedMCQA,以及 MMLU 里的医学子集。任何人都可以把自己的模型提交上来,页面还能按模型类型、精度、规模来筛选。想给那些权重公开、可以自己部署的(open-weights)医学模型做一次初筛,这是最方便的入口。

它的短板是结构性的。这些考卷大多是选择题(MCQ),考的是知识背诵,属于所谓的 MultiMedQA 这一类。如今顶尖模型基本都答得上来,所以这个榜已经饱和(saturated),也就是高分模型扎堆挤在天花板附近、分不出高下,对模型在真实临床里怎么表现、安不安全、会不会好好沟通,几乎说明不了什么。建议把它当成一个快速判断知识下限的工具,而不是决定要不要部署某个模型的依据。

① 权威 Authority
学术/机构/引用

维护方 maintainersOpen Life Science AI, Hugging Face
机构数 institutions0
更新节奏 cadenceirregular
在线榜 online

引用

② 人气 Popularity
≠ 质量

HF Space

③ 能力 Capability
榜内排名

无榜内排名(本身不是排名榜 / 数据集)。

拿它挑模型用(MoA 选型输入)
如果你要把几个模型搭成团队,这里是从这个榜能取到的参考

能力轴 medical-knowledge-QA

模态 text   部署 open-weights

适合 recommended for

注意 caveats

↑ 返回顶部 · ← 返回总览