llm-judge
设计可运行的 LLM 评测量表、裁判提示词与执行脚本
- Stars
- 0
- Forks
- 0
- 更新时间
- 更新于 2026年4月23日
设计可运行的 LLM 评测量表、裁判提示词与执行脚本
该 Skill 从评测范围开始,帮助定义可测量的量表,为每个标准生成降低偏差的裁判提示词,并输出可运行的 Python 评测脚本。脚本支持按内容哈希增量重跑、文件变化监听、轨迹步骤归因和人与裁判一致性校准;独立运行示例需要 Anthropic API key。
资源类型
使用场景
运行平台
核心能力
把复杂业务流程梳理、封装并测试为可复用的 AI Skill。
用 Markdown 定义可在多种编码助手中复用的任务型子代理。
GitHub 公开事实最近同步于 2026年7月10日。
自动查找、创建、执行并根据实际结果改进智能体技能
精简检索与提示上下文,降低大模型调用的令牌消耗