← 返回总览

SWE-bench medium

online-leaderboardgeneralcodesoftware-engineeringagentictext

2024 · https://www.swebench.com/ · freshness: fresh live,持续收提交;但前沿分已聚到 ~80% 并列,作为‘谁更强’的区分器在饱和,价值更多在‘能不能真修代码’这条门槛。

专家判语 Expert verdict medium

Verified 已多家并列 ~80% 饱和,叠加已知 gold-patch 污染,原始/Verified 分对我已基本没有区分力。在 MoA 里选编码冠军模型不再据它定主信号——改看 SWE-bench Live 这类滚动、抗污染的榜才算数;原始分只当历史参照与及格门槛。

— 署名 chenhao · 2026-06-22

它是什么 Agent summary 事实 · AI 整理

SWE-bench 是给 AI 出的一份“修代码”考卷(benchmark,基准测试),由 Princeton NLP 的 Jimenez、Yang 等人做出来,论文入选 ICLR 2024 oral。现在它基本被当成衡量 AI 能不能修真实代码的标准榜。这里的“修代码”对象,既可以是普通模型,也可以是 agent(能自己分步骤、调用工具干活的 AI,也叫智能体)。

考题本身很实在:先给 AI 一个真实的 GitHub issue(代码仓库里登记的待修 bug 或需求),再配上对应仓库当时的代码快照,要求 AI 生成一个 patch(提交的代码修改)。改完之后,用这个仓库自带的 unit test(自动跑的测试用例,用来判定改对没有)来跑一遍,只有测试通过,这道题才算 resolved(问题被解决)。换句话说,它是从头到尾真跑一遍、看结果的评测,不是做选择题。最早这套题有 2294 道,覆盖 12 个 Python 仓库。

后来又分出几个子集和变体。Verified 是 OpenAI 和原作者一起做的人工核验过的子集(SWE-bench Verified),从原始题里挑出 500 道干净题,把那些描述不清、根本没法做、测试时灵时不灵的题剔掉了,现在各家发布会报成绩基本都用它。Lite 是 300 道的轻量版,此外还有 Multimodal、Multilingual 等。配套的 agent 工具叫 SWE-agent,出自同一个团队。

挑模型时有两点要特别留意。第一,数据污染(模型提前见过考题、靠背答案虚高)是公开存在的问题:issue 和标准答案补丁(gold patch)在 SWE-bench 发布前就可能被模型在训练时见过,OpenAI 自己查过,发现前沿模型能一字不差地复现部分标准答案,所以高分里可能掺了“背出来”的成分。为对抗这一点,社区做了 SWE-bench Live 等变体,不断把新出现的 issue 加进来。第二,这份榜在顶尖模型这一段已经快考满了:到 2026 年中,Claude Opus 4.x、Gemini 3.x Pro 等多家前沿模型在 Verified 上的成绩都在 80% 左右、统计上分不出高下,所以它当“谁更强”的尺子越来越不好使了。不过当作一道“能不能真修代码”的及格门槛,它仍然有用。

① 权威 Authority
学术/机构/引用

维护方 maintainersCarlos Jimenez & John Yang et al. (Princeton NLP / Stanford); SWE-bench Verified 子集由 OpenAI 与原作者合作发布
机构数 institutions0
更新节奏 cadencelive
在线榜 online
引用数 citations2000 (Google Scholar (约数,持续增长), 2026-06-17)

引用

② 人气 Popularity
≠ 质量

trending

③ 能力 Capability
榜内排名

模型轴 axis名次许可备注
前沿模型(多家并列)software-engineering1closed2026 年中 Verified 上 Claude Opus 4.x / Gemini 3.x Pro 等多家在 ~80% 统计并列——榜在前沿已趋饱和、区分度下降

拿它挑模型用(MoA 选型输入)
如果你要把几个模型搭成团队,这里是从这个榜能取到的参考

能力轴 software-engineeringcode-generationagentictool-userepo-level-reasoning

模态 text   部署 apiopen-weights

适合 recommended for

注意 caveats

↑ 返回顶部 · ← 返回总览