OpenAI Evals

不活跃
GitHub Python NOASSERTION

简介

OpenAI 推出的 LLM 评估框架,提供标准化的基准测试注册表和工具集,用于系统评估大语言模型和 LLM 系统的性能表现。

核心特性

  • 开源评估注册表,用于测试 LLM 性能的不同维度
  • 使用基本和模型评分模板创建自定义评估,无需编写代码
  • 支持私有评估,在不暴露数据的情况下评估工作流中的 LLM 模式
  • Completion Function Protocol,支持提示链和工具使用智能体等高级场景
  • Snowflake 集成,将评估结果记录到数据库
  • 可直接在 OpenAI Dashboard 中配置和运行

适用场景

💡 评估和基准测试不同 LLM 模型版本对你的用例的影响
💡 构建自定义评估,测试你关心的特定 LLM 能力
💡 对 LLM 系统进行红队测试和安全评估
💡 跟踪模型在迭代中的性能改进
💡 向 OpenAI 社区贡献评估基准

优势与不足

优势

  • 社区热度高(19.4k stars)
  • 项目有一定历史沉淀(已维护 3 年)

⚠️ 不足

  • 缺少明确的开源许可证

快速开始

1. 安装:pip install evals
2. 设置 API key:export OPENAI_API_KEY=your_key
3. 下载评估数据:git lfs fetch --all && git lfs pull
4. 运行:oaieval <eval_name> --api_base <api_base>
5. 或创建自定义评估:pip install -e . 并参考 docs/build-eval.md

相关项目

UQLM

1.2k · Python
活跃 A+

CVS Health 开源的 LLM 不确定性量化库,用于基于 UQ 的幻觉检测,提供置信度评分和幻觉缓解工具,帮助识别和降低 LLM 输出的不可靠内容。

hallucination-detectionuncertainty-quantificationllm-evaluation +2
  • · 提供五类不确定性量化评分器:Black-Box(一致性)、White-Box(Token 概率)、LLM-as-a-Judge、Ensemble 和 Long-Text
  • · Black-Box 评分器通过多次生成和比较测量响应一致性,兼容任何 LLM,开箱即用
  • · White-Box 评分器利用 Token 概率估算不确定性,单次生成即可评分,速度快成本低

Guardrails AI

7.4k · Python
活跃 A+

Guardrails AI 为大语言模型添加可编程的安全护栏,通过输入输出验证、结构化数据提取和自定义校验器确保 LLM 应用的可靠性和安全性。

guardrailsllm-safetyvalidation +2
  • · Input/Output Guard 输入输出护栏:检测、量化和缓解 LLM 特定风险
  • · Guardrails Hub 预构建验证器生态:RegexMatch、CompetitorCheck、ToxicLanguage 等开箱即用
  • · Pydantic 结构化输出:通过函数调用或 prompt 优化强制 LLM 输出指定格式

Garak

9.1k · Python
活跃 A

NVIDIA 开源的 LLM 漏洞扫描器,可自动检测大语言模型中的安全漏洞、幻觉倾向、越狱风险和提示注入等安全问题,是 LLM 安全评估的核心工具。

llm-securityvulnerability-scannerllm-evaluation +2
  • · 自动扫描 LLM 漏洞,检测幻觉、数据泄露、提示注入和越狱攻击
  • · 结合静态、动态和自适应探针进行全面安全评估
  • · 广泛支持 LLM:Hugging Face、OpenAI、AWS Bedrock、Replicate、llama.cpp 及 REST 接口模型

OpenCompass

7.4k · Python
活跃 A

OpenCompass 是一个全面的 LLM 评估平台,支持 Llama、Mistral、GPT-4、Qwen、GLM、Claude 等多种模型在 100+ 数据集上的基准评测。

llm-evaluationbenchmarkevaluation-platform +1
  • · 支持 100+ 数据集的全面基准评测,覆盖知识、推理、数学、代码等多个维度
  • · 兼容主流 LLM:Llama、Mistral、GPT-4、Qwen、GLM、Claude 等
  • · CascadeEvaluator 级联评估机制,支持多个评估器按顺序协作