评测或基准研究与知识

super-benchmark

评测智能体能否配置并运行真实研究仓库中的任务

Stars
53
Forks
4
License
Apache-2.0
更新于
更新于 2026年6月1日

正在检查仓库实时数据……

项目概览

SUPER 用来自真实机器学习与自然语言处理研究仓库的任务,评估 LLM 智能体是否能完成环境配置、代码执行和结果回答。数据集包含 Expert、Masked 与 AutoGen 三组任务,并附带运行和评估代码;本地模式会直接在机器上执行代码,官方也提供 Docker 与 Modal 方案以降低隔离风险并支持并发测试。

仓库事实

主要语言
Jupyter Notebook
许可证
Apache-2.0
仓库更新时间
2026年6月1日
默认分支
main

资源类型

评测或基准

使用场景

研究与知识

运行方式

本地运行

核心能力

代码执行验证与评测

相关项目

查看更多同类项目