agent-skills-eval
对比加载与不加载 Skill 的结果,验证它是否真的提升智能体表现。
- Stars
- 620
- Forks
- 33
- 更新时间
- 更新于 2026年7月13日
对比加载与不加载 Skill 的结果,验证它是否真的提升智能体表现。
agent-skills-eval 是面向 Agent Skills 的测试运行器,会用同一组提示分别执行“加载 Skill”和“基线”两种模式,再交给评审模型按断言打分。它输出完整的 JSON/JSONL 运行记录和可直接打开的静态 HTML 报告,便于查看每个 Skill 的实际增益、失败点、耗时和工具调用。项目提供 CLI 与 TypeScript SDK,支持兼容 OpenAI Chat API 的模型及自定义提供商,运行时需自行指定目标模型和评审模型。
资源类型
使用场景
运行方式
用统一 API 自动化并测试 Chromium、Firefox 和 WebKit。
统一远程控制、自动化和管理多台 Android 设备
核心能力
GitHub 公开事实最近同步于 2026年7月14日。
用统一命令配置并运行网页、移动端和负载测试。
先选架构,再创建、评估和打包可复用的 AI Skill