SWE-bench medium
online-leaderboardgeneralcodesoftware-engineeringagentictext
2024 · https://www.swebench.com/ · freshness: fresh live,持续收提交;但前沿分已聚到 ~80% 并列,作为‘谁更强’的区分器在饱和,价值更多在‘能不能真修代码’这条门槛。
专家判语 Expert verdict medium
Verified 已多家并列 ~80% 饱和,叠加已知 gold-patch 污染,原始/Verified 分对我已基本没有区分力。在 MoA 里选编码冠军模型不再据它定主信号——改看 SWE-bench Live 这类滚动、抗污染的榜才算数;原始分只当历史参照与及格门槛。
— 署名 chenhao · 2026-06-22
它是什么 Agent summary 事实 · AI 整理
SWE-bench 是给 AI 出的一份“修代码”考卷(benchmark,基准测试),由 Princeton NLP 的 Jimenez、Yang 等人做出来,论文入选 ICLR 2024 oral。现在它基本被当成衡量 AI 能不能修真实代码的标准榜。这里的“修代码”对象,既可以是普通模型,也可以是 agent(能自己分步骤、调用工具干活的 AI,也叫智能体)。
考题本身很实在:先给 AI 一个真实的 GitHub issue(代码仓库里登记的待修 bug 或需求),再配上对应仓库当时的代码快照,要求 AI 生成一个 patch(提交的代码修改)。改完之后,用这个仓库自带的 unit test(自动跑的测试用例,用来判定改对没有)来跑一遍,只有测试通过,这道题才算 resolved(问题被解决)。换句话说,它是从头到尾真跑一遍、看结果的评测,不是做选择题。最早这套题有 2294 道,覆盖 12 个 Python 仓库。
后来又分出几个子集和变体。Verified 是 OpenAI 和原作者一起做的人工核验过的子集(SWE-bench Verified),从原始题里挑出 500 道干净题,把那些描述不清、根本没法做、测试时灵时不灵的题剔掉了,现在各家发布会报成绩基本都用它。Lite 是 300 道的轻量版,此外还有 Multimodal、Multilingual 等。配套的 agent 工具叫 SWE-agent,出自同一个团队。
挑模型时有两点要特别留意。第一,数据污染(模型提前见过考题、靠背答案虚高)是公开存在的问题:issue 和标准答案补丁(gold patch)在 SWE-bench 发布前就可能被模型在训练时见过,OpenAI 自己查过,发现前沿模型能一字不差地复现部分标准答案,所以高分里可能掺了“背出来”的成分。为对抗这一点,社区做了 SWE-bench Live 等变体,不断把新出现的 issue 加进来。第二,这份榜在顶尖模型这一段已经快考满了:到 2026 年中,Claude Opus 4.x、Gemini 3.x Pro 等多家前沿模型在 Verified 上的成绩都在 80% 左右、统计上分不出高下,所以它当“谁更强”的尺子越来越不好使了。不过当作一道“能不能真修代码”的及格门槛,它仍然有用。
① 权威 Authority
学术/机构/引用
| 维护方 maintainers | Carlos Jimenez & John Yang et al. (Princeton NLP / Stanford); SWE-bench Verified 子集由 OpenAI 与原作者合作发布 |
|---|---|
| 机构数 institutions | 0 |
| 更新节奏 cadence | live |
| 在线榜 online | 是 |
| 引用数 citations | 2000 (Google Scholar (约数,持续增长), 2026-06-17) |
引用
- SWE-bench: Can Language Models Resolve Real-World GitHub Issues? (Jimenez et al., ICLR 2024 oral) · 2026-06-17
- SWE-bench 官方榜与文档(原始 / Verified / Lite / Multimodal / Multilingual) · 2026-06-17
- SWE-bench — 代码与数据(SWE-bench/SWE-bench, GitHub) · 2026-06-17
- Introducing SWE-bench Verified(OpenAI 与原作者合作的 500 题人工校验子集) · 2026-06-17
② 人气 Popularity
≠ 质量
trending③ 能力 Capability
榜内排名
| 模型 | 轴 axis | 名次 | 许可 | 备注 |
|---|---|---|---|---|
| 前沿模型(多家并列) | software-engineering | 1 | closed | 2026 年中 Verified 上 Claude Opus 4.x / Gemini 3.x Pro 等多家在 ~80% 统计并列——榜在前沿已趋饱和、区分度下降 |
拿它挑模型用(MoA 选型输入)
如果你要把几个模型搭成团队,这里是从这个榜能取到的参考
能力轴 software-engineeringcode-generationagentictool-userepo-level-reasoning
模态 text 部署 apiopen-weights
适合 recommended for
- 为‘修真实代码库 / 编码 agent’选模型——这是该能力事实上的标准榜,且端到端可执行(测试通过才算修好)
- 用 Verified 子集而非原始集做横比(原始集含噪声/不可解任务)
- 需要抗污染的当下能力快照时,优先看 SWE-bench Live 等滚动变体
注意 caveats
- 数据污染明确存在:gold patch 早于发布即可能进训练集,高分可能含记忆成分
- 前沿已 ~80% 并列饱和,Verified 分很难再区分顶尖模型;真实工程能力差距未必反映在这一个数上
- 纯 Python、issue→patch 这一种工作流;不代表多语言、架构设计、调试等更广的工程能力