SWE-bench
用真实 GitHub 问题评测代码补丁修复能力
- Stars
- 5,386
- Forks
- 918
- 开源许可
- MIT
从真实需求出发,按使用场景、资源形态、运行方式和仓库事实,筛选可以直接使用、组合或继续构建的开源项目。
用真实 GitHub 问题评测代码补丁修复能力
在多种交互环境中评测大模型作为智能体的能力
对比把 Web 应用封装成桌面软件的主流框架与运行成本
用统一 Gym 环境开发和评测网页智能体
创建技能评测套件并比较不同模型的执行效果
训练和评测模型解决抽象网格变换推理任务
为 Agent Skills 运行可重复的发现与使用评测
为不同模型和智能体运行框架编译、评测并优化技能。
研究自主 Agent 的主动工具发现,并提供 MCP 工具检索数据集。
批量运行并评分不同模型在 ARC-AGI 任务上的表现
用真实交互任务评测 LLM Agent 的工具调用和长期应用操作。
用百万 token 长上下文和真实场景评测自主 Agent 的长期任务能力。
用数据集、评分器和奖励函数评估有状态 Agent 的多轮表现。
在 Docker 中跨模型评测代理技能,并比较其稳定性
评测智能体能否配置并运行真实研究仓库中的任务
用带标注的 Agent 执行轨迹评测推理、执行和规划错误。
用 AAQ 量化组织的 AI 成熟度与发展层级