AgencyBench
用百万 token 长上下文和真实场景评测自主 Agent 的长期任务能力。
- Stars
- 89
- Forks
- 4
- 更新时间
- 更新于 2026年7月10日
用百万 token 长上下文和真实场景评测自主 Agent 的长期任务能力。
AgencyBench V2 覆盖游戏、前端、后端、代码、研究和 MCP 六类能力,提供 32 个真实长期场景、138 个任务及对应查询、交付物和评分规则。评测用用户模拟 Agent 迭代反馈,并在 Docker sandbox 中执行功能与视觉检查,结合规则、视觉和 LLM judge;场景通常需要模型 API 配置,游戏和前端还需要远程 Docker sandbox。
资源类型
使用场景
运行方式
用真实交互任务评测 LLM Agent 的工具调用和长期应用操作。
在 Docker 中跨模型评测代理技能,并比较其稳定性
协议与集成
核心能力
适合人群
GitHub 公开事实最近同步于 2026年7月10日。
用带标注的 Agent 执行轨迹评测推理、执行和规划错误。
批量运行并评分不同模型在 ARC-AGI 任务上的表现