项目概览
该 Skill 从评测范围开始,帮助定义可测量的量表,为每个标准生成降低偏差的裁判提示词,并输出可运行的 Python 评测脚本。脚本支持按内容哈希增量重跑、文件变化监听、轨迹步骤归因和人与裁判一致性校准;独立运行示例需要 Anthropic API key。
仓库事实
- 主要语言
- Python
- 许可证
- MIT
- 仓库更新时间
- 2026年4月23日
- 默认分支
- main
资源类型
通用技能
使用场景
AI 与智能体开发
运行平台
Claude Code、Codex 等
核心能力
验证与评测
设计可运行的 LLM 评测量表、裁判提示词与执行脚本
正在检查仓库实时数据……
该 Skill 从评测范围开始,帮助定义可测量的量表,为每个标准生成降低偏差的裁判提示词,并输出可运行的 Python 评测脚本。脚本支持按内容哈希增量重跑、文件变化监听、轨迹步骤归因和人与裁判一致性校准;独立运行示例需要 Anthropic API key。
资源类型
使用场景
运行平台
核心能力