Lighteval

活跃
GitHub Python MIT

简介

HuggingFace 推出的一站式 LLM 评估工具包,支持多种后端的模型评测,与 HuggingFace 生态深度集成,提供灵活的评估指标和基准配置。

核心特性

  • 1000+ 评估任务 — 覆盖知识、数学、代码、对话、多语言和 NLU 基准
  • 多后端支持 — 通过 Accelerate、VLLM、SGLang、Nanotron 或远程推理端点进行评估
  • 自定义任务和指标 — 使用自定义任务和指标定义构建定制化评估流水线
  • 逐样本结果 — 保存详细的逐样本输出用于调试和模型比较
  • HuggingFace 生态集成 — 将结果推送到 Hub,使用 Open Benchmark Index 发现基准
  • Python API 和 CLI — 使用命令行界面或编程 Python API 进行评估

适用场景

💡 在 MMLU、GSM8K 和 HumanEval 等标准基准上对 LLM 进行基准测试
💡 在多种后端和硬件配置上比较模型性能
💡 针对特定领域或多语言模型评估的自定义评估流水线
💡 部署前自动化模型质量门控的 CI/CD 集成
💡 通过标准化评估报告和追踪实现研究可重复性

快速开始

# 安装
pip install lighteval

# 通过 CLI 评估
lighteval eval "hf-inference-providers/openai/gpt-oss-20b" gpqa:diamond

# 或使用 Python API
from lighteval.pipeline import Pipeline, PipelineParameters
pipeline = Pipeline(model=model, pipeline_parameters=params, tasks='gsm8k')
results = pipeline.evaluate()

相关项目