项目概览
AgentBench 用八类环境检验大模型能否自主完成数据库、操作系统等交互任务,并提供统一运行与比较框架。当前仓库包含与 AgentRL 集成的函数调用版本;完整环境依赖 Docker,旧版基准的依赖较老,使用 Python 3.9 通常更稳妥。
仓库事实
- 主要语言
- Python
- 许可证
- Apache-2.0
- 仓库更新时间
- 2026年7月9日
- 默认分支
- main
资源类型
评测或基准
使用场景
研究与知识
运行方式
Docker
核心能力
验证与评测
在多种交互环境中评测大模型作为智能体的能力
正在检查仓库实时数据……
AgentBench 用八类环境检验大模型能否自主完成数据库、操作系统等交互任务,并提供统一运行与比较框架。当前仓库包含与 AgentRL 集成的函数调用版本;完整环境依赖 Docker,旧版基准的依赖较老,使用 Python 3.9 通常更稳妥。
资源类型
使用场景
运行方式
核心能力