OpenCompass

活跃
GitHub Python Apache-2.0

简介

OpenCompass 是一个全面的 LLM 评估平台,支持 Llama、Mistral、GPT-4、Qwen、GLM、Claude 等多种模型在 100+ 数据集上的基准评测。

核心特性

  • 支持 100+ 数据集的全面基准评测,覆盖知识、推理、数学、代码等多个维度
  • 兼容主流 LLM:Llama、Mistral、GPT-4、Qwen、GLM、Claude 等
  • CascadeEvaluator 级联评估机制,支持多个评估器按顺序协作
  • 内置 LLM-as-Judge 和数学推理评估器(MATHVerifyEvaluator)
  • CompassHub 评测排行榜和 CompassRank 模型排名可视化
  • 被 Meta AI 官方推荐,集成到 Llama Get Started 流程中

适用场景

💡 对自研或微调模型进行全面的多维度基准测评
💡 对比不同 LLM 在特定任务上的表现,辅助模型选型
💡 跟踪模型迭代版本的性能变化,检测能力回归
💡 构建企业内部 LLM 评测流水线,自动化模型准入验证
💡 复现学术论文中的评测结果,验证模型声称的能力

快速开始

pip install opencompass,通过 OpenCompass 配置文件指定模型和数据集,运行 opencompass 命令启动评测。支持 ModelScope 按需加载数据集,内置 CompassHub 排行榜可视化结果。

相关项目