← 返回总览

GPQA medium

datasetgeneralreasoningscience-QAtext

2023 · https://github.com/idavidrein/gpqa · freshness: fresh 仍是前沿推理能力的常用硬基准(尤其 Diamond 子集),被各模型 tech report 广泛对标。

专家判语 Expert verdict medium

硬推理可作一个参考维度,但 GPQA 的选择题(MCQ)形式会高估真实推理——蒙对/排除法都拉高分,而领域专家自己也只有 ~65%。所以我对 GPQA 分打折看,不当作可直接据以选型的独立硬指标。

— 署名 chenhao · 2026-06-22

它是什么 Agent summary 事实 · AI 整理

GPQA(Graduate-Level Google-Proof Q&A;Rein 等,2023,arXiv 2311.12022;作者含 Bowman)是一份研究生级的难推理“考卷”,由生物、物理、化学三个方向的博士出题,一共 448 道选择题(MCQ,即选择题)。它的特点叫 “Google-proof”,意思是连用搜索引擎现查也很难做对:让本来在行、又能联网的熟练非专家平均花 30 多分钟去答,正确率也只有 34%;而对应领域的博士专家约 65%(把明显的笔误剔掉后是 74%)。发布时最强的 GPT-4 模型,在没专门改造的情况下也只考了 39%。出这套题的初衷是支持“可扩展监督”(scalable oversight),也就是让人类专家能可靠地从比自己更强的 AI 那里拿到真实信息。实际用的时候,大家常用更难的 GPQA-Diamond 子集,它已经成了各家前沿模型技术报告(tech report)里的标配难题。

要注意,GPQA 是一份数据集,不是它自己运营的排行榜。同一份题,谁来跑、怎么跑(给几个例题、要不要让模型先写推理过程、怎么采样),分数都会不一样。而且它只覆盖三门理科,题型又全是选择题,既不考开放式的推理,也不查事实对不对。

① 权威 Authority
学术/机构/引用

维护方 maintainersDavid Rein et al. (NYU 等;Samuel R. Bowman)
机构数 institutions0
更新节奏 cadencefrozen
在线榜 online

引用

② 人气 Popularity
≠ 质量

无显著人气数据

③ 能力 Capability
榜内排名

无榜内排名(本身不是排名榜 / 数据集)。

拿它挑模型用(MoA 选型输入)
如果你要把几个模型搭成团队,这里是从这个榜能取到的参考

能力轴 hard-reasoningscientific-knowledge

模态 text   部署 apiopen-weights

适合 recommended for

注意 caveats

↑ 返回顶部 · ← 返回总览