开发框架测试与调试

agent-skills-eval

对比加载与不加载 Skill 的结果,验证它是否真的提升智能体表现。

Stars
620
Forks
33
License
MIT
更新于
更新于 2026年7月13日

正在检查仓库实时数据……

项目概览

agent-skills-eval 是面向 Agent Skills 的测试运行器,会用同一组提示分别执行“加载 Skill”和“基线”两种模式,再交给评审模型按断言打分。它输出完整的 JSON/JSONL 运行记录和可直接打开的静态 HTML 报告,便于查看每个 Skill 的实际增益、失败点、耗时和工具调用。项目提供 CLI 与 TypeScript SDK,支持兼容 OpenAI Chat API 的模型及自定义提供商,运行时需自行指定目标模型和评审模型。

仓库事实

主要语言
TypeScript
许可证
MIT
仓库更新时间
2026年7月13日
默认分支
main

资源类型

开发框架命令行应用SDK

使用场景

测试与调试AI 与智能体开发

运行方式

命令行本地运行

核心能力

验证与评测

相关项目

查看更多同类项目