项目概览
AgencyBench V2 覆盖游戏、前端、后端、代码、研究和 MCP 六类能力,提供 32 个真实长期场景、138 个任务及对应查询、交付物和评分规则。评测用用户模拟 Agent 迭代反馈,并在 Docker sandbox 中执行功能与视觉检查,结合规则、视觉和 LLM judge;场景通常需要模型 API 配置,游戏和前端还需要远程 Docker sandbox。
仓库事实
- 主要语言
- Python
- 许可证
- MIT
- 仓库更新时间
- 2026年7月10日
- 默认分支
- main
资源类型
评测或基准数据集开发框架
使用场景
测试与调试AI 与智能体开发研究与知识
运行方式
Docker本地运行沙箱运行
协议与集成
MCP
核心能力
计算机操作数据可视化人工介入验证与评测
适合人群
开发者研究人员