AgentBench
不活跃简介
ICLR 2024 论文,全面的 LLM Agent 评估基准,涵盖操作系统、数据库、知识图谱、数字卡片游戏等多维度任务。
核心特性
- 首个全面评估 LLM 作为自主 Agent 在 8 种不同环境中表现的基准测试
- 涵盖操作系统交互、数据库操作、知识图谱、数字卡牌游戏和横向思维谜题
- AgentBench FC 将函数调用式提示与 AgentRL 强化学习框架集成
- 通过 Docker Compose 实现所有 5 个核心任务的完全容器化部署
- 发布排行榜追踪模型性能,持续接受社区贡献和更新
- 支持 Dev 和 Test 数据集划分,多轮交互需要数千次 LLM 生成
适用场景
💡 在真实世界 Agent 能力上基准测试和比较不同 LLM 模型
💡 评估模型在结构化工具使用场景中的函数调用性能
💡 使用集成的 AgentRL 强化学习框架训练和验证 Agent 行为
💡 研究 Agent 在包括操作系统、数据库和 Web 在内的多样化任务环境中的失败模式
分类
快速开始
克隆仓库并设置:`conda create -n agent-bench python=3.9 && conda activate agent-bench && pip install -r requirements.txt`。为你想测试的任务构建所需的 Docker 镜像。在 `configs/agents/openai-chat.yaml` 中配置 OpenAI API 密钥。启动任务工作器并运行基准测试。