incident-to-eval
把生产 AI Agent 事故还原成可重复运行的回归测试案例。
- Stars
- 0
- Forks
- 0
- 更新时间
- 更新于 2026年7月6日
把生产 AI Agent 事故还原成可重复运行的回归测试案例。
incident-to-eval 从事故或复盘材料重建发生经过,按 Agent 专用分类判断失败类型,并生成可供任意 runner 执行的 JSON 回归案例。案例包含最小复现输入、封闭断言集合和运行时机,格式由确定性校验器验证;它不是评估平台或 runner,而是把一次真实失败转成长期防回归的守卫。
资源类型
使用场景
运行平台
运行方式
不用常规截图也能测试移动与桌面应用导航流程。
用自然语言控制逻辑分析仪并解码常见数字协议
核心能力
GitHub 公开事实最近同步于 2026年7月10日。
把一次浏览探索转成可重复执行的端到端测试
用自然语言查询 CloudWatch 日志并排查 AWS 故障