项目概览
agent-skills-eval 是面向 Agent Skills 的测试运行器,会用同一组提示分别执行“加载 Skill”和“基线”两种模式,再交给评审模型按断言打分。它输出完整的 JSON/JSONL 运行记录和可直接打开的静态 HTML 报告,便于查看每个 Skill 的实际增益、失败点、耗时和工具调用。项目提供 CLI 与 TypeScript SDK,支持兼容 OpenAI Chat API 的模型及自定义提供商,运行时需自行指定目标模型和评审模型。
仓库事实
- 主要语言
- TypeScript
- 许可证
- MIT
- 仓库更新时间
- 2026年7月13日
- 默认分支
- main
资源类型
开发框架命令行应用SDK
使用场景
测试与调试AI 与智能体开发
运行方式
命令行本地运行
核心能力
验证与评测