letta-evals
用数据集、评分器和奖励函数评估有状态 Agent 的多轮表现。
- Stars
- 77
- Forks
- 12
- 更新时间
- 更新于 2026年7月8日
用数据集、评分器和奖励函数评估有状态 Agent 的多轮表现。
Letta Evals 为 Letta Agent 提供从 dataset、target、extractor、grader 到 reward 和 result 的评测框架,支持 JSONL/CSV 数据集、多轮输入、多模型运行和缓存结果复评。目标通常通过 Letta Code CLI 连接自托管或云端 Letta server,并要求 Python 3.11+ 和模型提供商 API key;套件也适合在 CI 中重复运行。
资源类型
使用场景
运行方式
先选架构,再创建、评估和打包可复用的 AI Skill
用统一 API 自动化并测试 Chromium、Firefox 和 WebKit。
协议与集成
核心能力
适合人群
GitHub 公开事实最近同步于 2026年7月10日。
统一远程控制、自动化和管理多台 Android 设备
对比加载与不加载 Skill 的结果,验证它是否真的提升智能体表现。