评测或基准测试与调试

vitabench

用真实交互任务评测 LLM Agent 的工具调用和长期应用操作。

Stars
156
Forks
17
License
MIT
更新于
更新于 2026年7月10日

正在检查仓库实时数据……

项目概览

VitaBench 面向配送、店内和 OTA 等真实生活服务场景,提供跨场景数据、API 工具和每个领域 100 个任务,用来评测 Agent 的读写与通用工具调用。你可以配置模型后运行 vita 命令,把模拟结果保存到 data/simulations 并重新评测;当前版本更新了数据集、工具、评测模型和指标,结果需要结合具体配置解读。

仓库事实

主要语言
Python
许可证
MIT
仓库更新时间
2026年7月10日
默认分支
main

资源类型

评测或基准命令行应用数据集开发框架

使用场景

测试与调试AI 与智能体开发个人与日常生活研究与知识

运行方式

命令行本地运行

核心能力

数据可视化人工介入工具调用验证与评测工作流自动化

适合人群

开发者研究人员

相关项目

查看更多同类项目