vitabench
用真实交互任务评测 LLM Agent 的工具调用和长期应用操作。
- Stars
- 156
- Forks
- 17
- 更新时间
- 更新于 2026年7月10日
用真实交互任务评测 LLM Agent 的工具调用和长期应用操作。
VitaBench 面向配送、店内和 OTA 等真实生活服务场景,提供跨场景数据、API 工具和每个领域 100 个任务,用来评测 Agent 的读写与通用工具调用。你可以配置模型后运行 vita 命令,把模拟结果保存到 data/simulations 并重新评测;当前版本更新了数据集、工具、评测模型和指标,结果需要结合具体配置解读。
资源类型
使用场景
用百万 token 长上下文和真实场景评测自主 Agent 的长期任务能力。
在 Docker 中跨模型评测代理技能,并比较其稳定性
运行方式
核心能力
适合人群
GitHub 公开事实最近同步于 2026年7月10日。
用带标注的 Agent 执行轨迹评测推理、执行和规划错误。
批量运行并评分不同模型在 ARC-AGI 任务上的表现