SWE-bench

类型:评测数据集(arXiv:2310.06770,ICLR 2024) 内容:从真实 GitHub 仓库收集的 issue + 对应 PR,要求模型修改代码库让测试通过 规模:2,294 个任务 / 12 个 Python 仓库 子类:Verified(500 题,人工过滤)、Lite(300)、Multilingual(300)、Multimodal(517)

它是”模型能不能真的干活”这一类评测的起点,也是同一模型换框架分数差异巨大这一事实最著名的展示场。


它测什么

真实的软件工程任务:跨函数、跨文件的协同修改,最后用仓库的单元测试判定成败。

论文发表时的基线(对比今天的进步很有意思):

“The best-performing model, Claude 2, is able to solve a mere 1.96% of the issues.”

2023 年榜单刚发布时,表现最好的模型 Claude 2 只能解决 1.96% 的问题——这个数字可以让你对「三年前的智能体编程能力有多原始」有个直观感受。

用它的三条注意事项

1. 必须说明用的是什么 harness

SWE-bench 官网的 Top 榜统一使用 mini-SWE-agent 这一个最小框架。第三方聚合站的数值差异,很大一部分来自 harness 不同。

Codesota 的明确警示:

“Pass-rate depends on agent scaffolding; two runs of the same base model can differ by double digits.”

通过率取决于用的是什么智能体脚手架;同一个基座模型跑两次,分数能差出两位数。(这也是为什么看 SWE-bench 分数必须先问「用的是什么 agent」。)

2. 跨来源的数值会对不上

2026-08-31 抓取时,Claude Opus 4.5 在不同聚合站分别记为 80.9%(BenchLM)、79.2%(Metatext)、80.8%(aitooltier);BenchLM 对 Claude Opus 5 给出的 96% 明显高于其他来源。

引用时必须注明来源与抓取日期。

3. 它正在饱和

BenchLM 的观察:

“The top models are clustered within 1.0 points, suggesting this benchmark is nearing saturation for frontier models.”

排名靠前的模型分数挤在 1 分以内,说明这个榜对前沿模型来说快要饱和、区分不出高下了。看榜时需要注意这点。

2026-08-31 的官方榜(mini-SWE-agent 口径,Top 5)

名次模型% Resolved平均成本日期
1Claude 4.5 Opus high76.80$0.752026-02-17
2Gemini 3 Flash high75.80$0.362026-02-17
2MiniMax M2.5 high75.80$0.072026-02-17
4Claude 4.6 Opus75.60$0.552026-02-17
5Claude 4.5 Opus medium74.40$0.722025-11-24

注意成本列:第一名与并列第二的差值是 0.4 个百分点,而成本差了 10 倍。这是”跑分之外还有性价比”的典型例子。另注意:官网最新条目日期为 2026-02-26,落后于第三方聚合站约半年。

相关页面