← 返回总览

MEDIQA-Chat 2023 low

shared-taskmedicalclinical-nlpdialogue-summarizationtext

2023 · https://aclanthology.org/2023.clinicalnlp-1.52/ · freshness: aging 2023 shared task,基线属前-前沿-LLM 时代;任务(环境式病历生成)依然当下,但 leaderboard 快照已过时。

专家判语 Expert verdict low

人工署名(chenhao)。值得回答:一个 2023 shared-task 快照如今该算几分? 我认为很低 MTS-Dialog/ACI-Bench 是否仍是环境式 scribe 的参考,还是已被超越? 如果只是评测结构化病历能力,我认为还是可以参考的;就看榜单是否还更新了。

— 署名 chenhao · 2026-06-16

它是什么 Agent summary 事实 · AI 整理

MEDIQA-Chat 2023 是一场公开评测竞赛(shared task),2023 年在 ACL 会议下属的 ClinicalNLP Workshop 上举办,由 Asma Ben Abacha 等人组织(来自 Microsoft / Nuance),主题是给医患对话做摘要和生成。它分三个任务。Task A 是把对话里的一段段内容压成就诊记录的对应片段(Dialogue2Note),再给片段标上章节标题,用的是 MTS-Dialog 数据集(约 1.7k 段短对话配好摘要,其中 1,201 条用于训练、100 条用于验证)。Task B 是把整段对话写成一份完整的临床病历(clinical note,即就诊记录),用的是 ACI-Bench 数据集。Task C 反过来,根据病历自动生成对话(Note2Dialogue),用来扩充训练数据。一共 17 支队伍参赛。打分用的是三种自动指标的组合:ROUGE、BERTScore、BLEURT——它们都是按机器输出和参考答案的重合程度自动算分;组织方还用 Pearson 相关系数检验这些自动分和人工打分是否一致。

它瞄准的是“环境式记录助手”(ambient scribe)这类用法,也就是医生看诊时,系统在旁边把对话直接转成结构化的就诊记录。这是一个生成类任务,正好补上本集合里其它几份偏选择题背诵或行为测试的榜单。它也有几个短板:这是一次性的 2023 年比赛,当时的基线模型还在顶级大模型出现之前;而且按重合度算分的指标,对病历是否在临床上写对了事实,反映得并不够。

① 权威 Authority
学术/机构/引用

维护方 maintainersAsma Ben Abacha et al. (Microsoft / Nuance), ACL ClinicalNLP Workshop
机构数 institutions0
更新节奏 cadencefrozen
在线榜 online

引用

② 人气 Popularity
≠ 质量

无显著人气数据

③ 能力 Capability
榜内排名

无榜内排名(本身不是排名榜 / 数据集)。

拿它挑模型用(MoA 选型输入)
如果你要把几个模型搭成团队,这里是从这个榜能取到的参考

能力轴 clinical-note-generationdialogue-summarizationambient-scribe

模态 text   部署 apiopen-weights

适合 recommended for

注意 caveats

↑ 返回顶部 · ← 返回总览