← 返回总览

MEDIQA Shared Tasks(2024–2025 系列) medium

shared-taskmedicalclinicalmultimodaltextimage

2024 · https://sites.google.com/view/mediqa-shared-tasks · freshness: fresh 系列仍在持续办(2025 届有 WV/OE/MAGIC);但每届是独立 shared task、题量小,作为‘年度临床任务风向标’用,不是常更新的在线排行榜。

专家判语 Expert verdict medium

人工署名(chenhao)。值得回答: 1) 这种"逐年换题、贴临床实务"的 shared task, 在你的信任标尺里能不能补 HealthBench/MedQA 这类大榜测不到的真实性? 权重给多少? 只要够新(2年内),比HealthBench这种肯定要高,高出20%吧 2) 题量小(常数百例)→ 单届排名波动大;你会把它当"任务/数据来源"还是当"模型排名依据"? 不存在这类分法,一切以用户为中心;题型虽小但是若有名气、比较新,则可以参考的 3) 哪一两届(CORR 纠错 / OE 医嘱抽取 / WV 图文) 对你的临床 MoA 最有选型价值,为什么? CORR、OE最有用。因为MoA一般是全流程、要注意幻觉率的

— 署名 chenhao · 2026-06-17

它是什么 Agent summary 事实 · AI 整理

MEDIQA 是医学 NLP(用计算机处理医学文本的研究方向)圈子里办了很多年的一系列 shared task(公开评测竞赛:大家在同一套题、同一套数据上比成绩)。它挂在 ClinicalNLP / BioNLP 这两个学术研讨会下面(隶属 NAACL/ACL 这些会议),近两年还借 CLEF/ImageCLEF 办了带图像的赛题。它的价值不在于做一个长期更新的在线排行榜,而是每年针对临床真实任务出一套新题、配好标注答案,让研究者上场比拼,主办方再写一篇 overview(总结)论文。本条专门补上 2023 之后的同系列赛题(这些之前靠按名字搜索容易漏掉):

- MEDIQA-CORR 2024:病历错误检测与纠正,也就是给一段临床文本挑错、再改对。 - MEDIQA-M3G 2024:多语言、多模态(同时处理文字和图像)的医学答案生成,场景是皮肤科的大众健康图文问答。 - MEDIQA-MAGIC 2024/2025:远程医疗里的图文问答,还要把皮肤病变的区域圈出来(分割)并回答封闭式问题(办在 CLEF/ImageCLEF)。 - MEDIQA-WV 2025:伤口护理的图文 VQA(看图回答问题,Visual Question Answering),英文和中文双语,接着 M3G 的皮肤科方向往下做。 - MEDIQA-OE 2025:从医患对话里抽取医嘱(orders,医生开的检查、用药等指令)。

几个要点。这些题用的都是新做、逐年更换的数据,所以旧的训练集很难提前“背”到答案,而且贴近临床实务(真实的文本、对话、图像,而不是那种刷到饱和的 MCQ(选择题)死记考点)。代价是每届题量小、领域窄,单届成绩的统计意义有限,只能当作“今年临床任务往哪走”的风向标,不能拿来推断一个模型的通用医学能力。它和已有的 MEDIQA-Chat 2023(见 [mediqa-chat] 条目)出自同一系列。

① 权威 Authority
学术/机构/引用

维护方 maintainersMEDIQA 组织方(ClinicalNLP / BioNLP workshop 系列;NAACL / ACL / CLEF)
机构数 institutions0
更新节奏 cadenceyearly
在线榜 online

引用

② 人气 Popularity
≠ 质量

无显著人气数据

③ 能力 Capability
榜内排名

无榜内排名(本身不是排名榜 / 数据集)。

拿它挑模型用(MoA 选型输入)
如果你要把几个模型搭成团队,这里是从这个榜能取到的参考

能力轴 clinical-qamedical-error-correctionmultimodal-medical-vqaclinical-note-generationmedical-order-extraction

模态 textimage   部署 apiopen-weights

适合 recommended for

注意 caveats

↑ 返回顶部 · ← 返回总览