skillgrade
为 Agent Skills 运行可重复的发现与使用评测
- Stars
- 618
- Forks
- 45
- 更新时间
- 更新于 2026年7月14日
为 Agent Skills 运行可重复的发现与使用评测
Skillgrade 可从带有 SKILL.md 的目录生成 eval.yaml,并用多轮任务检查 Agent 是否能正确发现和应用技能。它支持 Gemini、Claude、Codex、ACP、OpenCode 和自定义命令,可组合确定性评分与 LLM 量表,并通过命令行或浏览器查看结果;运行环境需要 Node.js 20+,Docker、模型密钥或本地命令按所选执行器决定。
资源类型
使用场景
运行平台
运行方式
创建技能评测套件并比较不同模型的执行效果
用 eBPF 追踪 AI Agent 的进程、文件、网络和模型调用。
协议与集成
核心能力
GitHub 公开事实最近同步于 2026年7月14日。
用一条命令汇总并筛选 Databricks 作业日志
从终端诊断受企业认证门禁保护的线上 Web 应用