← 返回总览

SWE-Bench Pro medium

online-leaderboardgeneralcodesoftware-engineeringagentictext

2025 · https://labs.scale.com/leaderboard/swe_bench_pro_public · freshness: fresh 2025-09 首发、2025-11 修订;很新。作为 SWE-bench 在‘前沿已 ~80% 饱和’后的**抗污染 + 长程**接棒榜收入,与既有 swe-bench 条目互为对照(刻意收的近族,增量在难度与污染控制)。

专家判语 Expert verdict medium

1) 你已有 SWE-bench(Verified)条目。SWE-bench Pro 作为"更难+抗污染"近族,值不值得在 MoA 选码模型时单独看? 我认为它是 Verified 饱和后直接换它当主信号 2) Scale AI 既是作者又是榜主、private 集不公开: 这种 vendor 自评 + 不可复核, 你给它的权威性打几折? 8折, 因为符合我&人们对ClaudeCode/Codex的编程体验排序。 3) public 集 ~40% 的分,你读成"agent 还远不能做长程工程"的证据,还是"在长程任务上已有可用下限"? 对你的 agent 选型阈值意味着什么? 我认为是长程任务上已有可用下限;agent 选型阈值:根据经验公式,至少40%分才可以进行长程工程。

— 署名 chenhao · 2026-06-17

它是什么 Agent summary 事实 · AI 整理

SWE-Bench Pro(由数据标注公司 Scale AI 制作,arXiv 2509.16941,2025-09 首发 / 2025-11 修订)是 SWE-bench 的续作,目标是“更难、更抗背答案”。它要解决老 SWE-bench 的两个毛病:一是顶尖模型在上面已经能做到约 80% 的题,大家挤在高分区,分不出高下(术语叫“饱和”);二是它的标准答案补丁很早就进了各家模型的训练数据,模型可能是“见过答案”而不是真会做。

出题方式和 SWE-bench 一样。它给模型一个真实的 GitHub issue(代码仓库里登记的待修 bug 或需求),再加上当时的代码快照,让能自己分步骤、调用工具干活的 AI(agent,智能体)写出一段代码修改(patch,补丁);改完后用这个仓库自带的、自动跑的测试用例(unit test)来判定改对没有,通过了就算解决。整个过程是真把代码跑起来,不是做选择题。和老版的区别在于“长程”(long-horizon):一道题往往要改好几个文件、动很多地方,一个专业工程师都得花几小时到几天才能搞定;所有题目都经过人工核对、补齐了上下文,确保确实有解。全套共 1,865 题、41 个仓库,分三层:public(公开集,731 题 / 11 仓)、held-out(留存集,858 题 / 12 仓,不公开)、commercial(商用集,276 题 / 18 个真实创业公司的私有代码库,不公开)。

抗“背答案”(contamination-resistant)用了两招。第一,public 和 held-out 只选用“强 copyleft(GPL)”许可证的仓库,这类许可证在法律上限制别人随便把代码塞进训练集,等于抬高了泄题门槛。第二,commercial 集干脆花钱买真实创业公司的私有代码,外人根本拿不到,自然没法泄漏。held-out 和 commercial 都不公开,专门用来检查模型是不是只是“背熟了公开题”(过拟合)。

成绩看 2025-11 的论文口径。public 集上最好的是 Claude Sonnet 4.5,43.6%;Claude Sonnet 4 紧随,42.7%;GPT-5(high)41.8%。到了更难的 commercial 集,分数进一步掉到 16% 到 18% 左右。对比 SWE-bench Verified 已经约 80% 的饱和成绩,Pro 重新把好坏拉开了距离,这正是它的价值所在。

最后提醒读者分清三种信号。这套题确实有真实的工程难度(能力是实打实的),但它的权威性要打折:Scale AI 既是出题人、又是榜单管理方、还是商业评测方,自己出题自己评,存在“自评”的循环嫌疑;private 和 commercial 集不公开,外部无法独立复核成绩。这一条的引用数没有核实到具体数值(基准很新),不臆造。

① 权威 Authority
学术/机构/引用

维护方 maintainersScale AI (Xiang Deng, Jeff Da 等 22 名作者)
机构数 institutions0
更新节奏 cadencelive
在线榜 online

引用

② 人气 Popularity
≠ 质量

无显著人气数据

③ 能力 Capability
榜内排名

模型轴 axis名次许可备注
Claude Sonnet 4.5software-engineering1closedpublic 集 43.6%(论文 v2,2025-11 口径);Claude Sonnet 4 42.7%、GPT-5(high)41.8% 紧随。注意整体仍低——比 SWE-bench Verified 的 ~80% 饱和区低一半多

拿它挑模型用(MoA 选型输入)
如果你要把几个模型搭成团队,这里是从这个榜能取到的参考

能力轴 software-engineeringcode-generationagenticlong-horizonrepo-level-reasoningtool-use

模态 text   部署 apiopen-weights

适合 recommended for

注意 caveats

↑ 返回顶部 · ← 返回总览