Harbor

活跃
GitHub Python Apache-2.0

简介

Agent 评估框架,支持运行 Agent 基准测试和创建强化学习环境,用于衡量和改进 Agent 性能

核心特性

  • 使用标准化基准评估 Claude Code、OpenHands、Codex CLI 等任意 Agent
  • 构建和分享自定义基准测试和评估环境
  • 通过 Daytona 和 Modal 提供商并行运行数千个环境实验
  • 生成 Agent 模型强化学习优化的 rollout 数据
  • Terminal-Bench-2.0 Agent 评估的官方测试工具
  • CLI 驱动的工作流,轻松集成到 CI/CD 管道

适用场景

💡 在标准化任务上对比和评测不同的编程 Agent
💡 从 Agent rollout 数据生成强化学习训练数据
💡 在云环境中运行大规模 Agent 评估
💡 将 Agent 性能测试集成到持续集成工作流中

快速开始

通过 `uv tool install harbor` 或 `pip install harbor` 安装。设置 API 密钥(如 `ANTHROPIC_API_KEY`),然后运行 `harbor run --dataset terminal-bench@2.0 --agent claude-code --model anthropic/claude-opus-4-1` 通过 Docker 在本地执行基准测试。

相关项目