AgentBench

不活跃
GitHub Python Apache-2.0

简介

ICLR 2024 论文,全面的 LLM Agent 评估基准,涵盖操作系统、数据库、知识图谱、数字卡片游戏等多维度任务。

核心特性

  • 首个全面评估 LLM 作为自主 Agent 在 8 种不同环境中表现的基准测试
  • 涵盖操作系统交互、数据库操作、知识图谱、数字卡牌游戏和横向思维谜题
  • AgentBench FC 将函数调用式提示与 AgentRL 强化学习框架集成
  • 通过 Docker Compose 实现所有 5 个核心任务的完全容器化部署
  • 发布排行榜追踪模型性能,持续接受社区贡献和更新
  • 支持 Dev 和 Test 数据集划分,多轮交互需要数千次 LLM 生成

适用场景

💡 在真实世界 Agent 能力上基准测试和比较不同 LLM 模型
💡 评估模型在结构化工具使用场景中的函数调用性能
💡 使用集成的 AgentRL 强化学习框架训练和验证 Agent 行为
💡 研究 Agent 在包括操作系统、数据库和 Web 在内的多样化任务环境中的失败模式

快速开始

克隆仓库并设置:`conda create -n agent-bench python=3.9 && conda activate agent-bench && pip install -r requirements.txt`。为你想测试的任务构建所需的 Docker 镜像。在 `configs/agents/openai-chat.yaml` 中配置 OpenAI API 密钥。启动任务工作器并运行基准测试。

相关项目