AgencyBench
用百万 token 长上下文和真实场景评测自主 Agent 的长期任务能力。
- Stars
- 89
- Forks
- 4
- 开源许可
- MIT
从真实需求出发,按使用场景、资源形态、运行方式和仓库事实,筛选可以直接使用、组合或继续构建的开源项目。
用百万 token 长上下文和真实场景评测自主 Agent 的长期任务能力。
用真实交互任务评测 LLM Agent 的工具调用和长期应用操作。
训练和评测模型解决抽象网格变换推理任务
用真实 Python 仓库任务训练和评测软件工程 Agent
用带标注的 Agent 执行轨迹评测推理、执行和规划错误。
用可组合图案配方生成可平铺的壁纸设计