MedQA (USMLE) low
datasetmedicalmedical-QAmultilingualtext
2020 · https://github.com/jind11/MedQA · freshness: stale 已饱和、且几乎肯定在训练数据里;前沿模型贴近天花板,故区分力很弱——但仍是别人据以构建的标准参考数据集。
专家判语 Expert verdict low
“太旧、很多模型在此过拟合”
人工署名(chenhao)。值得回答:一个已饱和、很可能被记忆的数据集,还该不该锚定一个医疗 leaderboard? 我认为不应该;但若在此榜单分数都太低,就要被直接排除。 MedQA 现在是不是最好当作负向过滤 (不过它的模型直接淘汰) 而非排名? 我认为是的。
— 署名 chenhao · 2026-06-16
它是什么 Agent summary 事实 · AI 整理
MedQA 是一份给 AI 出的医学题库(Jin et al., 2020;MIT / Szolovits 组),很多医疗类基准测试(benchmark,给 AI 出的标准考卷)都拿它当原料。要分清楚:它本身只是一套题目(数据集),不是排行榜,所以它自己不给模型排名。题目取自专业的医师执照考试,也就是美国执业医师资格考试(USMLE)那种风格,每道都是选择题(MCQ),4 个或 5 个选项,在当时它是第一个这么做的开放域问答数据集。它有三种语言版本:英文约 12,723 题(常见的划分是 10,178 题用于训练、1,273 题用于测试)、简体中文 34,251 题、繁体中文 14,123 题。刚发布那会儿,用传统的“先检索资料再读题作答”方法,英文准确率只有约 36.7%。后来的前沿大模型已经把成绩追到接近满分。
正因为它公开得早、用得多、年头久,MedQA 有两个老毛病。一是数据污染(模型在训练时可能提前见过这些题,靠背答案虚高);二是分数饱和,顶尖模型几乎都做满了。所以它还能当一条医学知识的“及格线”,也能当别人搭榜单时的共同配料,比如 Open Medical-LLM Leaderboard,它的 500 道题还被用在 RCQ 研究的一个环节里。但它已经很难区分最顶尖的几个模型,对模型在真实临床里怎么表现、安不安全,它什么也说不了。
① 权威 Authority
学术/机构/引用
| 维护方 maintainers | Di Jin / Eileen Pan et al. (MIT, Szolovits group) |
|---|---|
| 机构数 institutions | 0 |
| 更新节奏 cadence | frozen |
| 在线榜 online | 否 |
引用
② 人气 Popularity
≠ 质量
无显著人气数据③ 能力 Capability
榜内排名
无榜内排名(本身不是排名榜 / 数据集)。
拿它挑模型用(MoA 选型输入)
如果你要把几个模型搭成团队,这里是从这个榜能取到的参考
能力轴 medical-knowledge-QAmultilingual-medical
模态 text 部署 apiopen-weights
适合 recommended for
- 理解 QA 背诵榜到底由什么构成——MedQA 是它们共同的底料
- 一个多语种(EN / zh-Hans / zh-Hant)的医疗知识下限
注意 caveats
- 它是 DATASET,不是 leaderboard——没有官方排名;任何分数都取决于谁、怎么跑的
- 已饱和 + 很可能被记忆 → 贴近天花板,难以区分顶部模型
- 选择题背诵 ≠ 临床行为、安全或沟通