OpenAI Evals
不活跃简介
OpenAI 推出的 LLM 评估框架,提供标准化的基准测试注册表和工具集,用于系统评估大语言模型和 LLM 系统的性能表现。
核心特性
- 开源评估注册表,用于测试 LLM 性能的不同维度
- 使用基本和模型评分模板创建自定义评估,无需编写代码
- 支持私有评估,在不暴露数据的情况下评估工作流中的 LLM 模式
- Completion Function Protocol,支持提示链和工具使用智能体等高级场景
- Snowflake 集成,将评估结果记录到数据库
- 可直接在 OpenAI Dashboard 中配置和运行
适用场景
💡 评估和基准测试不同 LLM 模型版本对你的用例的影响
💡 构建自定义评估,测试你关心的特定 LLM 能力
💡 对 LLM 系统进行红队测试和安全评估
💡 跟踪模型在迭代中的性能改进
💡 向 OpenAI 社区贡献评估基准
快速开始
1. 安装:pip install evals
2. 设置 API key:export OPENAI_API_KEY=your_key
3. 下载评估数据:git lfs fetch --all && git lfs pull
4. 运行:oaieval <eval_name> --api_base <api_base>
5. 或创建自定义评估:pip install -e . 并参考 docs/build-eval.md