eval-harness-architect
为 LLM、Agent 或 RAG 建立可回归的评测与漂移门禁。
为 LLM、Agent 或 RAG 建立可回归的评测与漂移门禁。
eval-harness-architect 从评测要支持的决策开始,建立带隔离保留集的数据集、按质量维度选择评分器,并校准 LLM 评审。它会用多次试验计算显著性,接入 CI 回归门禁和 PR 分数卡,再把生产漂移与失败反馈回数据集;没有标签或数字时不会臆造。
资源类型
使用场景
运行平台
核心能力
不用常规截图也能测试移动与桌面应用导航流程。
用自然语言控制逻辑分析仪并解码常见数字协议
把一次浏览探索转成可重复执行的端到端测试
GitHub 公开事实最近同步于 2026年7月10日。
用自然语言查询 CloudWatch 日志并排查 AWS 故障