MEDIQA-Chat 2023 low
shared-taskmedicalclinical-nlpdialogue-summarizationtext
2023 · https://aclanthology.org/2023.clinicalnlp-1.52/ · freshness: aging 2023 shared task,基线属前-前沿-LLM 时代;任务(环境式病历生成)依然当下,但 leaderboard 快照已过时。
专家判语 Expert verdict low
人工署名(chenhao)。值得回答:一个 2023 shared-task 快照如今该算几分? 我认为很低 MTS-Dialog/ACI-Bench 是否仍是环境式 scribe 的参考,还是已被超越? 如果只是评测结构化病历能力,我认为还是可以参考的;就看榜单是否还更新了。
— 署名 chenhao · 2026-06-16
它是什么 Agent summary 事实 · AI 整理
MEDIQA-Chat 2023 是一场公开评测竞赛(shared task),2023 年在 ACL 会议下属的 ClinicalNLP Workshop 上举办,由 Asma Ben Abacha 等人组织(来自 Microsoft / Nuance),主题是给医患对话做摘要和生成。它分三个任务。Task A 是把对话里的一段段内容压成就诊记录的对应片段(Dialogue2Note),再给片段标上章节标题,用的是 MTS-Dialog 数据集(约 1.7k 段短对话配好摘要,其中 1,201 条用于训练、100 条用于验证)。Task B 是把整段对话写成一份完整的临床病历(clinical note,即就诊记录),用的是 ACI-Bench 数据集。Task C 反过来,根据病历自动生成对话(Note2Dialogue),用来扩充训练数据。一共 17 支队伍参赛。打分用的是三种自动指标的组合:ROUGE、BERTScore、BLEURT——它们都是按机器输出和参考答案的重合程度自动算分;组织方还用 Pearson 相关系数检验这些自动分和人工打分是否一致。
它瞄准的是“环境式记录助手”(ambient scribe)这类用法,也就是医生看诊时,系统在旁边把对话直接转成结构化的就诊记录。这是一个生成类任务,正好补上本集合里其它几份偏选择题背诵或行为测试的榜单。它也有几个短板:这是一次性的 2023 年比赛,当时的基线模型还在顶级大模型出现之前;而且按重合度算分的指标,对病历是否在临床上写对了事实,反映得并不够。
① 权威 Authority
学术/机构/引用
| 维护方 maintainers | Asma Ben Abacha et al. (Microsoft / Nuance), ACL ClinicalNLP Workshop |
|---|---|
| 机构数 institutions | 0 |
| 更新节奏 cadence | frozen |
| 在线榜 online | 否 |
引用
- Overview of the MEDIQA-Chat 2023 Shared Tasks on the Summarization & Generation of Doctor-Patient Conversations (ACL ClinicalNLP 2023) · 2026-06-16
- MEDIQA-Chat-2023 (organizer GitHub: data, baselines, eval) · 2026-06-16
- Aci-bench: a Novel Ambient Clinical Intelligence Dataset for Benchmarking Automatic Visit Note Generation (Nature Scientific Data, 2023) · 2026-06-16
② 人气 Popularity
≠ 质量
无显著人气数据③ 能力 Capability
榜内排名
无榜内排名(本身不是排名榜 / 数据集)。
拿它挑模型用(MoA 选型输入)
如果你要把几个模型搭成团队,这里是从这个榜能取到的参考
能力轴 clinical-note-generationdialogue-summarizationambient-scribe
模态 text 部署 apiopen-weights
适合 recommended for
- 评测医患对话 → 临床病历摘要(环境式 scribe 用例)
- 一个具体的生成/摘要任务,补充 QA 背诵榜与行为榜
注意 caveats
- 体裁是一次性 shared task,不是持续维护的 leaderboard——结果是 2023 年快照
- ROUGE/BERTScore/BLEURT 更能反映表层重叠,而非临床事实性
- 在临床-NLP 圈内有名;不是 HealthBench 那种面向大众的 leaderboard