Harbor
活跃简介
Agent 评估框架,支持运行 Agent 基准测试和创建强化学习环境,用于衡量和改进 Agent 性能
核心特性
- 使用标准化基准评估 Claude Code、OpenHands、Codex CLI 等任意 Agent
- 构建和分享自定义基准测试和评估环境
- 通过 Daytona 和 Modal 提供商并行运行数千个环境实验
- 生成 Agent 模型强化学习优化的 rollout 数据
- Terminal-Bench-2.0 Agent 评估的官方测试工具
- CLI 驱动的工作流,轻松集成到 CI/CD 管道
适用场景
💡 在标准化任务上对比和评测不同的编程 Agent
💡 从 Agent rollout 数据生成强化学习训练数据
💡 在云环境中运行大规模 Agent 评估
💡 将 Agent 性能测试集成到持续集成工作流中
分类
快速开始
通过 `uv tool install harbor` 或 `pip install harbor` 安装。设置 API 密钥(如 `ANTHROPIC_API_KEY`),然后运行 `harbor run --dataset terminal-bench@2.0 --agent claude-code --model anthropic/claude-opus-4-1` 通过 Docker 在本地执行基准测试。