项目概览
SWE-bench 从真实 GitHub 仓库抽取代码库与 issue,要求受测智能体给出能够解决问题的补丁,并通过可复现的 Docker 环境进行验证。它适合比较编程智能体和语言模型的实际修复能力,但本地评测资源消耗较高,建议使用 x86_64 机器并准备至少 120GB 存储和 16GB 内存。
仓库事实
- 主要语言
- Python
- 许可证
- MIT
- 仓库更新时间
- 2026年7月10日
- 默认分支
- main
资源类型
评测或基准
使用场景
软件开发
运行方式
Docker
核心能力
验证与评测