SWE-bench
用真实 GitHub 问题评测代码补丁修复能力
- Stars
- 5,386
- Forks
- 918
- 更新时间
- 更新于 2026年7月10日
用真实 GitHub 问题评测代码补丁修复能力
SWE-bench 从真实 GitHub 仓库抽取代码库与 issue,要求受测智能体给出能够解决问题的补丁,并通过可复现的 Docker 环境进行验证。它适合比较编程智能体和语言模型的实际修复能力,但本地评测资源消耗较高,建议使用 x86_64 机器并准备至少 120GB 存储和 16GB 内存。
资源类型
使用场景
运行方式
核心能力
对比把 Web 应用封装成桌面软件的主流框架与运行成本
用统一接口调用百余种模型并集中治理 LLM 流量
GitHub 公开事实最近同步于 2026年7月10日。
为 Cursor 项目挑选并复用适配不同技术栈的规则文件
在浏览器或 Node.js 应用中流式下载与分享 BitTorrent 文件。