评测或基准测试与调试

arc-agi-benchmarking

批量运行并评分不同模型在 ARC-AGI 任务上的表现

Stars
351
Forks
69
License
MIT
更新于
更新于 2026年7月3日

正在检查仓库实时数据……

项目概览

该工具用统一配置在 ARC-AGI 任务上调用 OpenAI、Anthropic、Gemini 等模型适配器,并处理并发、限流、重试、结果保存和评分。它既支持单题调试也支持批量评测;使用完整 ARC-AGI 数据需另行克隆数据集,调用商业模型还需相应 API 凭据。

仓库事实

主要语言
Python
许可证
MIT
仓库更新时间
2026年7月3日
默认分支
main

资源类型

评测或基准

使用场景

测试与调试

运行方式

命令行本地运行

相关项目

查看更多同类项目