评测或基准软件开发

SWE-bench

用真实 GitHub 问题评测代码补丁修复能力

Stars
5,386
Forks
918
License
MIT
更新于
更新于 2026年7月10日

正在检查仓库实时数据……

项目概览

SWE-bench 从真实 GitHub 仓库抽取代码库与 issue,要求受测智能体给出能够解决问题的补丁,并通过可复现的 Docker 环境进行验证。它适合比较编程智能体和语言模型的实际修复能力,但本地评测资源消耗较高,建议使用 x86_64 机器并准备至少 120GB 存储和 16GB 内存。

仓库事实

主要语言
Python
许可证
MIT
仓库更新时间
2026年7月10日
默认分支
main

资源类型

评测或基准

使用场景

软件开发

运行方式

Docker

核心能力

验证与评测

相关项目

查看更多同类项目