← 返回总览

MedHELM medium

online-leaderboardmedicalclinical-taskstext

2025 · https://medhelm.org/ · freshness: fresh 2025 年初公布;2026 年起社区主导。

专家判语 Expert verdict medium

“子榜单很经典很全面。然而,模型不太全、更新不太频繁”

人工署名(chenhao)。值得回答: 逐任务的整体评测是否让 MedHELM 成为医疗榜里最强的 MoA 选型输入? 我认为不是,因为它最新不太频、且模型类别不全。 "没有单一排名" 对一个非领域工程师是帮助还是妨碍? 我认为很难讲。没有单一排名的话,某个场景我选任意模型应该都可以;当然,其他榜单可能会补充该信息的。

— 署名 chenhao · 2026-06-16

它是什么 Agent summary 事实 · AI 整理

HELM 是 Stanford(斯坦福)做的一套统一评测框架,给各家大模型用同一套标准打分。MedHELM(Holistic Evaluation of Language Models)就是把这套框架搬到医疗领域的版本。

它给模型出了 121 个临床任务的“考卷”,并按一套经临床医生核对过的分类把这些任务归了类:5 大类(Clinical Decision Support 临床决策支持、Patient Communication 医患沟通、Clinical Note Generation 病历书写、Medical Research Assistance 医学研究辅助、Administration & Workflow 行政与流程),其下又分 22 个子类、35 个 benchmark(基准测试,给 AI 出的标准考卷)。

这套东西在 2025 年初由 Stanford 生物医学信息研究中心(BMIR)、Stanford Health Care 与 Microsoft(微软)Health & Life Sciences 合作公布,参与的临床医生覆盖 15 个医学专科。2026 年起,它转为独立的社区主导项目。

它有一个很特别的做法:不给出一个总排名数字,而是按大类、按任务分别报告每个模型的表现,让读者根据自己实际的工作场景去挑模型。

① 权威 Authority
学术/机构/引用

维护方 maintainersStanford CRFM / BMIR, Stanford Health Care, Microsoft Health & Life Sciences, community-led (2026)
机构数 institutions0
更新节奏 cadenceirregular
在线榜 online

引用

② 人气 Popularity
≠ 质量

无显著人气数据

③ 能力 Capability
榜内排名

无榜内排名(本身不是排名榜 / 数据集)。

拿它挑模型用(MoA 选型输入)
如果你要把几个模型搭成团队,这里是从这个榜能取到的参考

能力轴 clinical-decision-supportpatient-communicationclinical-note-generationmedical-research-assistanceadmin-workflow

模态 text   部署 apiopen-weights

适合 recommended for

注意 caveats

↑ 返回顶部 · ← 返回总览