trail-benchmark
用带标注的 Agent 执行轨迹评测推理、执行和规划错误。
- Stars
- 20
- Forks
- 1
- 更新时间
- 更新于 2026年6月27日
用带标注的 Agent 执行轨迹评测推理、执行和规划错误。
TRAIL 是一个 Agent 轨迹基准数据集,包含 148 条带标注的执行轨迹和 841 个推理、执行与规划错误,来源覆盖软件工程和信息检索任务。你可以用兼容 LiteLLM 的模型运行 GAIA 或 SWE Bench 划分,再用评分脚本汇总结果;它适合研究复杂 Agent 工作流中的错误定位。
资源类型
使用场景
运行方式
用真实交互任务评测 LLM Agent 的工具调用和长期应用操作。
用百万 token 长上下文和真实场景评测自主 Agent 的长期任务能力。
核心能力
适合人群
GitHub 公开事实最近同步于 2026年7月10日。
在 Docker 中跨模型评测代理技能,并比较其稳定性
批量运行并评分不同模型在 ARC-AGI 任务上的表现