arc-agi-benchmarking
批量运行并评分不同模型在 ARC-AGI 任务上的表现
- Stars
- 351
- Forks
- 69
- 更新时间
- 更新于 2026年7月3日
批量运行并评分不同模型在 ARC-AGI 任务上的表现
该工具用统一配置在 ARC-AGI 任务上调用 OpenAI、Anthropic、Gemini 等模型适配器,并处理并发、限流、重试、结果保存和评分。它既支持单题调试也支持批量评测;使用完整 ARC-AGI 数据需另行克隆数据集,调用商业模型还需相应 API 凭据。
资源类型
使用场景
运行方式
GitHub 公开事实最近同步于 2026年7月10日。
用真实交互任务评测 LLM Agent 的工具调用和长期应用操作。
用百万 token 长上下文和真实场景评测自主 Agent 的长期任务能力。
在 Docker 中跨模型评测代理技能,并比较其稳定性
用带标注的 Agent 执行轨迹评测推理、执行和规划错误。