← 返回总览

BRIDGE high

online-leaderboardmedicalclinical-textmultilingualtext

2025 · https://huggingface.co/spaces/YLab-Open/BRIDGE-Medical-Leaderboard · freshness: fresh 实时 leaderboard;模型覆盖数字(99 个 LLM)为截至 2025-11-04。

专家判语 Expert verdict high

“Harvard, MGH等权威机构,且榜单比较新”

人工署名(chenhao)。"真实临床文本" 的真实性, 是否足以让人信任 BRIDGE 用于路由? 我认为是的。 9 语种覆盖对非英语部署有什么价值? 在中国没有价值。

— 署名 chenhao · 2026-06-16

它是什么 Agent summary 事实 · AI 整理

BRIDGE(arXiv 2504.19467,2025;由 YLab-Open 维护)是一份给 AI 出的标准考卷(benchmark,基准测试),专门考多种语言下对真实临床文本的理解。它有 87 个临床文本任务,覆盖 9 种语言、超过 1,000,000 条样本。每个模型会在三种答题设置下打分:zero-shot(不给例子直接答)、few-shot(先看几道带答案的例题再答)、chain-of-thought(让模型把推理一步步写出来再给结论)。

配套的 HuggingFace Space 上有一个在线榜单(leaderboard),已经系统地考过 99 个前沿大模型(LLM,即没做专门改造的通用大模型那一类),数字截至 2025-11-04。

它跟很多医疗考卷不一样的地方在于:题目取自真实临床文档,而不是考试式的选择题(MCQ)题库。这让它更贴近实际部署里处理临床文档的场景,代价是它不考多轮对话、安全和与患者的沟通。

① 权威 Authority
学术/机构/引用

维护方 maintainersYLab-Open
机构数 institutions0
更新节奏 cadencelive
在线榜 online

引用

② 人气 Popularity
≠ 质量

HF Space

③ 能力 Capability
榜内排名

无榜内排名(本身不是排名榜 / 数据集)。

拿它挑模型用(MoA 选型输入)
如果你要把几个模型搭成团队,这里是从这个榜能取到的参考

能力轴 clinical-text-understandingmultilingual-clinical

模态 text   部署 apiopen-weights

适合 recommended for

注意 caveats

↑ 返回顶部 · ← 返回总览