AgentBench
在多种交互环境中评测大模型作为智能体的能力
- Stars
- 3,557
- Forks
- 270
- 更新时间
- 更新于 2026年7月9日
在多种交互环境中评测大模型作为智能体的能力
AgentBench 用八类环境检验大模型能否自主完成数据库、操作系统等交互任务,并提供统一运行与比较框架。当前仓库包含与 AgentRL 集成的函数调用版本;完整环境依赖 Docker,旧版基准的依赖较老,使用 Python 3.9 通常更稳妥。
资源类型
使用场景
运行方式
核心能力
训练和评测模型解决抽象网格变换推理任务
评测智能体能否配置并运行真实研究仓库中的任务
GitHub 公开事实最近同步于 2026年7月10日。
在 Jupyter 或 nteract 中交互运行并分享 Go 代码笔记本。
把网页抓取并转换为适合智能体与 RAG 使用的干净内容。