评测或基准研究与知识

AgentBench

在多种交互环境中评测大模型作为智能体的能力

Stars
3,557
Forks
270
License
Apache-2.0
更新于
更新于 2026年7月9日

正在检查仓库实时数据……

项目概览

AgentBench 用八类环境检验大模型能否自主完成数据库、操作系统等交互任务,并提供统一运行与比较框架。当前仓库包含与 AgentRL 集成的函数调用版本;完整环境依赖 Docker,旧版基准的依赖较老,使用 Python 3.9 通常更稳妥。

仓库事实

主要语言
Python
许可证
Apache-2.0
仓库更新时间
2026年7月9日
默认分支
main

资源类型

评测或基准

使用场景

研究与知识

运行方式

Docker

核心能力

验证与评测

相关项目

查看更多同类项目