MedHELM medium
online-leaderboardmedicalclinical-taskstext
2025 · https://medhelm.org/ · freshness: fresh 2025 年初公布;2026 年起社区主导。
专家判语 Expert verdict medium
“子榜单很经典很全面。然而,模型不太全、更新不太频繁”
人工署名(chenhao)。值得回答: 逐任务的整体评测是否让 MedHELM 成为医疗榜里最强的 MoA 选型输入? 我认为不是,因为它最新不太频、且模型类别不全。 "没有单一排名" 对一个非领域工程师是帮助还是妨碍? 我认为很难讲。没有单一排名的话,某个场景我选任意模型应该都可以;当然,其他榜单可能会补充该信息的。
— 署名 chenhao · 2026-06-16
它是什么 Agent summary 事实 · AI 整理
HELM 是 Stanford(斯坦福)做的一套统一评测框架,给各家大模型用同一套标准打分。MedHELM(Holistic Evaluation of Language Models)就是把这套框架搬到医疗领域的版本。
它给模型出了 121 个临床任务的“考卷”,并按一套经临床医生核对过的分类把这些任务归了类:5 大类(Clinical Decision Support 临床决策支持、Patient Communication 医患沟通、Clinical Note Generation 病历书写、Medical Research Assistance 医学研究辅助、Administration & Workflow 行政与流程),其下又分 22 个子类、35 个 benchmark(基准测试,给 AI 出的标准考卷)。
这套东西在 2025 年初由 Stanford 生物医学信息研究中心(BMIR)、Stanford Health Care 与 Microsoft(微软)Health & Life Sciences 合作公布,参与的临床医生覆盖 15 个医学专科。2026 年起,它转为独立的社区主导项目。
它有一个很特别的做法:不给出一个总排名数字,而是按大类、按任务分别报告每个模型的表现,让读者根据自己实际的工作场景去挑模型。
① 权威 Authority
学术/机构/引用
| 维护方 maintainers | Stanford CRFM / BMIR, Stanford Health Care, Microsoft Health & Life Sciences, community-led (2026) |
|---|---|
| 机构数 institutions | 0 |
| 更新节奏 cadence | irregular |
| 在线榜 online | 是 |
引用
- MedHELM — Holistic Evaluation of Language Models for Medical Tasks · 2026-06-16
- MedHELM (CRFM HELM documentation) · 2026-06-16
② 人气 Popularity
≠ 质量
无显著人气数据③ 能力 Capability
榜内排名
无榜内排名(本身不是排名榜 / 数据集)。
拿它挑模型用(MoA 选型输入)
如果你要把几个模型搭成团队,这里是从这个榜能取到的参考
能力轴 clinical-decision-supportpatient-communicationclinical-note-generationmedical-research-assistanceadmin-workflow
模态 text 部署 apiopen-weights
适合 recommended for
- 为某个 SPECIFIC 临床工作流挑模型,而不是看单一的‘医疗 IQ’数字
- 跨 5 大任务族做整体对比,带逐类拆解
注意 caveats
- 设计上就是整体/多指标——没有单一头条排名;要逐类读
- 治理 2026 年从 Stanford+Microsoft 转为社区主导