OpenCompass

活跃
GitHub Python Apache-2.0

简介

OpenCompass 是一个全面的 LLM 评估平台,支持 Llama、Mistral、GPT-4、Qwen、GLM、Claude 等多种模型在 100+ 数据集上的基准评测。

核心特性

  • 支持 100+ 数据集的全面基准评测,覆盖知识、推理、数学、代码等多个维度
  • 兼容主流 LLM:Llama、Mistral、GPT-4、Qwen、GLM、Claude 等
  • CascadeEvaluator 级联评估机制,支持多个评估器按顺序协作
  • 内置 LLM-as-Judge 和数学推理评估器(MATHVerifyEvaluator)
  • CompassHub 评测排行榜和 CompassRank 模型排名可视化
  • 被 Meta AI 官方推荐,集成到 Llama Get Started 流程中

适用场景

💡 对自研或微调模型进行全面的多维度基准测评
💡 对比不同 LLM 在特定任务上的表现,辅助模型选型
💡 跟踪模型迭代版本的性能变化,检测能力回归
💡 构建企业内部 LLM 评测流水线,自动化模型准入验证
💡 复现学术论文中的评测结果,验证模型声称的能力

优势与不足

优势

  • 活跃维护,近期持续更新
  • 社区热度高(7.4k stars)
  • 开源许可证友好(Apache-2.0)
  • 项目有一定历史沉淀(已维护 3 年)

⚠️ 不足

  • Issue 积压较多(400 个 open issues)

快速开始

pip install opencompass,通过 OpenCompass 配置文件指定模型和数据集,运行 opencompass 命令启动评测。支持 ModelScope 按需加载数据集,内置 CompassHub 排行榜可视化结果。

相关项目

OpenAI Evals

19.4k · Python
不活跃 B

OpenAI 推出的 LLM 评估框架,提供标准化的基准测试注册表和工具集,用于系统评估大语言模型和 LLM 系统的性能表现。

llm-evaluationbenchmarkevals +2
  • · 开源评估注册表,用于测试 LLM 性能的不同维度
  • · 使用基本和模型评分模板创建自定义评估,无需编写代码
  • · 支持私有评估,在不暴露数据的情况下评估工作流中的 LLM 模式

HELM

2.9k · Python
活跃 A

HELM(Holistic Evaluation of Language Models)是斯坦福大学 CRFM 推出的语言模型综合评估框架,支持对大语言模型和多模态模型进行全面、可复现、透明的评估。

llm-evaluationbenchmarkstanford +2
  • · 标准化基准测试,包括 MMLU-Pro、GPQA、IFEval、WildBench
  • · 统一接口评估 OpenAI、Anthropic、Google 等厂商模型
  • · 超越准确率的指标 — 效率、偏见、毒性、公平性

UQLM

1.2k · Python
活跃 A+

CVS Health 开源的 LLM 不确定性量化库,用于基于 UQ 的幻觉检测,提供置信度评分和幻觉缓解工具,帮助识别和降低 LLM 输出的不可靠内容。

hallucination-detectionuncertainty-quantificationllm-evaluation +2
  • · 提供五类不确定性量化评分器:Black-Box(一致性)、White-Box(Token 概率)、LLM-as-a-Judge、Ensemble 和 Long-Text
  • · Black-Box 评分器通过多次生成和比较测量响应一致性,兼容任何 LLM,开箱即用
  • · White-Box 评分器利用 Token 概率估算不确定性,单次生成即可评分,速度快成本低

Guardrails AI

7.4k · Python
活跃 A+

Guardrails AI 为大语言模型添加可编程的安全护栏,通过输入输出验证、结构化数据提取和自定义校验器确保 LLM 应用的可靠性和安全性。

guardrailsllm-safetyvalidation +2
  • · Input/Output Guard 输入输出护栏:检测、量化和缓解 LLM 特定风险
  • · Guardrails Hub 预构建验证器生态:RegexMatch、CompetitorCheck、ToxicLanguage 等开箱即用
  • · Pydantic 结构化输出:通过函数调用或 prompt 优化强制 LLM 输出指定格式