← 返回总览

MedQA (USMLE) low

datasetmedicalmedical-QAmultilingualtext

2020 · https://github.com/jind11/MedQA · freshness: stale 已饱和、且几乎肯定在训练数据里;前沿模型贴近天花板,故区分力很弱——但仍是别人据以构建的标准参考数据集。

专家判语 Expert verdict low

“太旧、很多模型在此过拟合”

人工署名(chenhao)。值得回答:一个已饱和、很可能被记忆的数据集,还该不该锚定一个医疗 leaderboard? 我认为不应该;但若在此榜单分数都太低,就要被直接排除。 MedQA 现在是不是最好当作负向过滤 (不过它的模型直接淘汰) 而非排名? 我认为是的。

— 署名 chenhao · 2026-06-16

它是什么 Agent summary 事实 · AI 整理

MedQA 是一份给 AI 出的医学题库(Jin et al., 2020;MIT / Szolovits 组),很多医疗类基准测试(benchmark,给 AI 出的标准考卷)都拿它当原料。要分清楚:它本身只是一套题目(数据集),不是排行榜,所以它自己不给模型排名。题目取自专业的医师执照考试,也就是美国执业医师资格考试(USMLE)那种风格,每道都是选择题(MCQ),4 个或 5 个选项,在当时它是第一个这么做的开放域问答数据集。它有三种语言版本:英文约 12,723 题(常见的划分是 10,178 题用于训练、1,273 题用于测试)、简体中文 34,251 题、繁体中文 14,123 题。刚发布那会儿,用传统的“先检索资料再读题作答”方法,英文准确率只有约 36.7%。后来的前沿大模型已经把成绩追到接近满分。

正因为它公开得早、用得多、年头久,MedQA 有两个老毛病。一是数据污染(模型在训练时可能提前见过这些题,靠背答案虚高);二是分数饱和,顶尖模型几乎都做满了。所以它还能当一条医学知识的“及格线”,也能当别人搭榜单时的共同配料,比如 Open Medical-LLM Leaderboard,它的 500 道题还被用在 RCQ 研究的一个环节里。但它已经很难区分最顶尖的几个模型,对模型在真实临床里怎么表现、安不安全,它什么也说不了。

① 权威 Authority
学术/机构/引用

维护方 maintainersDi Jin / Eileen Pan et al. (MIT, Szolovits group)
机构数 institutions0
更新节奏 cadencefrozen
在线榜 online

引用

② 人气 Popularity
≠ 质量

无显著人气数据

③ 能力 Capability
榜内排名

无榜内排名(本身不是排名榜 / 数据集)。

拿它挑模型用(MoA 选型输入)
如果你要把几个模型搭成团队,这里是从这个榜能取到的参考

能力轴 medical-knowledge-QAmultilingual-medical

模态 text   部署 apiopen-weights

适合 recommended for

注意 caveats

↑ 返回顶部 · ← 返回总览