BRIDGE high
online-leaderboardmedicalclinical-textmultilingualtext
2025 · https://huggingface.co/spaces/YLab-Open/BRIDGE-Medical-Leaderboard · freshness: fresh 实时 leaderboard;模型覆盖数字(99 个 LLM)为截至 2025-11-04。
专家判语 Expert verdict high
“Harvard, MGH等权威机构,且榜单比较新”
人工署名(chenhao)。"真实临床文本" 的真实性, 是否足以让人信任 BRIDGE 用于路由? 我认为是的。 9 语种覆盖对非英语部署有什么价值? 在中国没有价值。
— 署名 chenhao · 2026-06-16
它是什么 Agent summary 事实 · AI 整理
BRIDGE(arXiv 2504.19467,2025;由 YLab-Open 维护)是一份给 AI 出的标准考卷(benchmark,基准测试),专门考多种语言下对真实临床文本的理解。它有 87 个临床文本任务,覆盖 9 种语言、超过 1,000,000 条样本。每个模型会在三种答题设置下打分:zero-shot(不给例子直接答)、few-shot(先看几道带答案的例题再答)、chain-of-thought(让模型把推理一步步写出来再给结论)。
配套的 HuggingFace Space 上有一个在线榜单(leaderboard),已经系统地考过 99 个前沿大模型(LLM,即没做专门改造的通用大模型那一类),数字截至 2025-11-04。
它跟很多医疗考卷不一样的地方在于:题目取自真实临床文档,而不是考试式的选择题(MCQ)题库。这让它更贴近实际部署里处理临床文档的场景,代价是它不考多轮对话、安全和与患者的沟通。
① 权威 Authority
学术/机构/引用
| 维护方 maintainers | YLab-Open |
|---|---|
| 机构数 institutions | 0 |
| 更新节奏 cadence | live |
| 在线榜 online | 是 |
引用
② 人气 Popularity
≠ 质量
HF Space③ 能力 Capability
榜内排名
无榜内排名(本身不是排名榜 / 数据集)。
拿它挑模型用(MoA 选型输入)
如果你要把几个模型搭成团队,这里是从这个榜能取到的参考
能力轴 clinical-text-understandingmultilingual-clinical
模态 text 部署 apiopen-weights
适合 recommended for
- 多语种、真实临床文本理解(不是考试 QA)
- 考察临床文档上 few-shot 与 chain-of-thought 的表现差异
注意 caveats
- 聚焦临床文本理解——不涉及对话安全或患者沟通
- 比 MCQ 榜更贴近部署文本,但偏任务抽取形态,不是端到端诊疗