inspect_evals
运行和扩展基于 Inspect AI 的模型评测集合
- Stars
- 575
- Forks
- 375
- 更新时间
- 更新于 2026年7月10日
运行和扩展基于 Inspect AI 的模型评测集合
Inspect Evals 汇集编码、安全、推理、知识等多类评测,用户可按文档安装后用 inspect eval 运行单项基准,也能修复现有评测或将外部实现登记到评测注册表。它主要面向研究者和评测工程师,推荐使用 Python 3.11 或 3.12。
资源类型
使用场景
核心能力
适合人群
让编码智能体生成多框架的自动化测试代码
为 QA 自动化团队提供可跨 AI 工具复用的测试代理与技能手册。
GitHub 公开事实最近同步于 2026年7月10日。
用统一 API 自动化并测试 Chromium、Firefox 和 WebKit。
用自然语言和视觉模型自动操作并测试界面