SWE-bench
活跃简介
SWE-bench 是一个评估大语言模型解决真实 GitHub Issue 能力的基准测试框架,包含来自多个流行 Python 仓库的真实问题,已成为衡量 AI 编程智能体能力的核心标准。
核心特性
- 基于真实 GitHub Issue 的 LLM 编程能力评估基准,来自多个流行 Python 仓库
- 提供 SWE-bench Lite(轻量版)、Verified(人工验证版)和 Multimodal(多模态版)等多个子集
- 完全容器化的 Docker 评估框架,确保结果可复现
- 支持本地评估和云端评估(Modal、AWS),灵活选择运行环境
- 配套 SWE-Llama 模型和 BM25/Oracle 检索增强数据集
- ICLR 2024 Oral 论文成果,已成为衡量 AI 编程智能体能力的核心标准
适用场景
💡 评估和对比不同 LLM/Agent 解决真实软件工程问题的能力
💡 训练和微调专门用于代码生成的模型(配合 SWE-smith 训练数据工具)
💡 研究 AI 在软件开发场景下的推理和代码修改能力
💡 为 AI 编程智能体提供标准化的评测和排名依据
分类
快速开始
安装 Docker 后,克隆仓库并运行 pip install -e . 安装。使用 python -m swebench.harness.run_evaluation 命令,指定数据集和预测结果路径即可运行评估。建议在 x86_64 机器上运行,至少 120GB 存储和 16GB 内存。