super-benchmark
评测智能体能否配置并运行真实研究仓库中的任务
- Stars
- 53
- Forks
- 4
- 更新时间
- 更新于 2026年6月1日
评测智能体能否配置并运行真实研究仓库中的任务
SUPER 用来自真实机器学习与自然语言处理研究仓库的任务,评估 LLM 智能体是否能完成环境配置、代码执行和结果回答。数据集包含 Expert、Masked 与 AutoGen 三组任务,并附带运行和评估代码;本地模式会直接在机器上执行代码,官方也提供 Docker 与 Modal 方案以降低隔离风险并支持并发测试。
资源类型
使用场景
运行方式
核心能力
在多种交互环境中评测大模型作为智能体的能力
训练和评测模型解决抽象网格变换推理任务
GitHub 公开事实最近同步于 2026年7月10日。
在 Jupyter 或 nteract 中交互运行并分享 Go 代码笔记本。
把网页抓取并转换为适合智能体与 RAG 使用的干净内容。