← 返回总览

RCQ (Real Clinical Queries) high

paper-boundmedicalclinical-deploymentreal-world-queriestext

2026 · https://www.nature.com/articles/s41591-026-04431-5 · freshness: fresh 2026-06-12 发表。静态基准,冻结于一篇论文与一组早-2026 模型快照;随模型进步会过时。

专家判语 Expert verdict high

人工署名(chenhao)。值得回答: 像 RCQ 这样小、真实、人工评判的基准, 在 MoA 选型里是否该比一个已饱和的 70 万题大榜权重更高? 我认为是的。 "n=100、单一研究、冻结" 该打多少折? 我认为, 在权威机构背书且榜单分数未饱和前, 权重依然会很高。 "临床工具 ≈ Google Search AI Overview" 对 "自建 vs 用前沿" 意味着什么? 我不清楚,可能意味着RAG/SKILL+强推理模型就是未来方向。

— 署名 chenhao · 2026-06-16

它是什么 Agent summary 事实 · AI 整理

RCQ(Real Clinical Queries,意思是“真实临床查询”)是一份小而看重真实场景的 benchmark(给 AI 出的标准考卷)。它出自一篇 Nature Medicine 研究(编号 s41591-026-04431-5,2026 年 6 月 12 日发表),作者来自 NYU Langone Health 和 University of Texas at Austin 这两家美国机构。它的题目是 100 条真实临床查询,也就是医生在日常看病时自己拿去问 AI(这里的 LLM 指大语言模型,就是 ChatGPT 那类会聊天答题的 AI)的问题。收集好之后,12 位美国临床医生在不知道答案出自哪个模型的情况下打分(也就是盲法评审),一共产生了 1,800 条“模型答某道题”的评价记录。RCQ 只是这篇论文三个测试环节中的一个,另外两个是 500 道 MedQA 题和 500 道 HealthBench 题。

最主要的结论是:几款最强的通用模型(GPT-5.2、Gemini 3.1 Pro、Claude Opus 4.6)赢过了专门给临床场景做的 AI 工具。在 RCQ 上,OpenEvidence 和 UpToDate Expert AI 的表现只跟 Google Search AI Overview(谷歌搜索结果上方那段 AI 总结)差不多,而临床医生更喜欢通用模型给的答案。RCQ 的好处是贴近真实使用、不容易被刷分:题目是真问题,又由人盲评打分。它的短板也很明显:只有 100 道题,样本太少,结论说服力有限;而且只是一项还没被别人重复验证过的研究,用的还是 2026 年初那一批模型,等于停在了那个时间点的快照上。

① 权威 Authority
学术/机构/引用

维护方 maintainersNYU Langone Health, University of Texas at Austin
机构数 institutions2
更新节奏 cadencefrozen
在线榜 online

引用

② 人气 Popularity
≠ 质量

无显著人气数据

③ 能力 Capability
榜内排名

模型轴 axis名次许可备注
GPT-5.2real-clinical-queriesclosed前沿梯队——胜过专用临床工具
Gemini 3.1 Proreal-clinical-queriesclosed前沿梯队
Claude Opus 4.6real-clinical-queriesclosed前沿梯队
OpenEvidencereal-clinical-queriesclosed专用临床工具——在 RCQ 上与 Google Search AI Overview 相当
UpToDate Expert AIreal-clinical-queriesclosed专用临床工具——较低梯队

拿它挑模型用(MoA 选型输入)
如果你要把几个模型搭成团队,这里是从这个榜能取到的参考

能力轴 real-clinical-query-handlingclinician-preferencedeployment-realism

模态 text   部署 api

适合 recommended for

注意 caveats

↑ 返回顶部 · ← 返回总览