评测或基准测试与调试

AgencyBench

用百万 token 长上下文和真实场景评测自主 Agent 的长期任务能力。

Stars
89
Forks
4
License
MIT
更新于
更新于 2026年7月10日

正在检查仓库实时数据……

项目概览

AgencyBench V2 覆盖游戏、前端、后端、代码、研究和 MCP 六类能力,提供 32 个真实长期场景、138 个任务及对应查询、交付物和评分规则。评测用用户模拟 Agent 迭代反馈,并在 Docker sandbox 中执行功能与视觉检查,结合规则、视觉和 LLM judge;场景通常需要模型 API 配置,游戏和前端还需要远程 Docker sandbox。

仓库事实

主要语言
Python
许可证
MIT
仓库更新时间
2026年7月10日
默认分支
main

资源类型

评测或基准数据集开发框架

使用场景

测试与调试AI 与智能体开发研究与知识

运行方式

Docker本地运行沙箱运行

协议与集成

MCP

核心能力

计算机操作数据可视化人工介入验证与评测

适合人群

开发者研究人员

相关项目

查看更多同类项目