skill-optimizer
在 Docker 中跨模型评测代理技能,并比较其稳定性
- Stars
- 70
- Forks
- 11
- 更新时间
- 更新于 2026年7月7日
在 Docker 中跨模型评测代理技能,并比较其稳定性
skill-optimizer 同时提供代理技能和本地 CLI,用测试用例与套件在 Docker 隔离环境中对技能做确定性评测,并通过 OpenRouter 在不同模型上运行多次试验。它可帮助编写、调试和比较评测结果,也支持把隐藏的 MCP 服务作为测试依赖。
资源类型
使用场景
运行平台
用真实交互任务评测 LLM Agent 的工具调用和长期应用操作。
用百万 token 长上下文和真实场景评测自主 Agent 的长期任务能力。
运行方式
核心能力
GitHub 公开事实最近同步于 2026年7月10日。
用带标注的 Agent 执行轨迹评测推理、执行和规划错误。
批量运行并评分不同模型在 ARC-AGI 任务上的表现