通用技能AI 与智能体开发

llm-judge

设计可运行的 LLM 评测量表、裁判提示词与执行脚本

Stars
0
Forks
0
License
MIT
更新于
更新于 2026年4月23日

正在检查仓库实时数据……

项目概览

该 Skill 从评测范围开始,帮助定义可测量的量表,为每个标准生成降低偏差的裁判提示词,并输出可运行的 Python 评测脚本。脚本支持按内容哈希增量重跑、文件变化监听、轨迹步骤归因和人与裁判一致性校准;独立运行示例需要 Anthropic API key。

仓库事实

主要语言
Python
许可证
MIT
仓库更新时间
2026年4月23日
默认分支
main

资源类型

通用技能

使用场景

AI 与智能体开发

运行平台

Claude Code、Codex 等

核心能力

验证与评测

相关项目

查看更多同类项目