评测或基准测试与调试

trail-benchmark

用带标注的 Agent 执行轨迹评测推理、执行和规划错误。

Stars
20
Forks
1
License
MIT
更新于
更新于 2026年6月27日

正在检查仓库实时数据……

项目概览

TRAIL 是一个 Agent 轨迹基准数据集,包含 148 条带标注的执行轨迹和 841 个推理、执行与规划错误,来源覆盖软件工程和信息检索任务。你可以用兼容 LiteLLM 的模型运行 GAIA 或 SWE Bench 划分,再用评分脚本汇总结果;它适合研究复杂 Agent 工作流中的错误定位。

仓库事实

主要语言
Python
许可证
MIT
仓库更新时间
2026年6月27日
默认分支
main

资源类型

评测或基准数据集

使用场景

测试与调试AI 与智能体开发

运行方式

命令行本地运行

核心能力

验证与评测

适合人群

开发者研究人员

相关项目

查看更多同类项目