LM Evaluation Harness

活跃
GitHub Python MIT

简介

EleutherAI 推出的大语言模型评估框架,提供标准化的少样本评测流水线,支持数百项基准任务,是 LLM 社区广泛采用的核心评测工具。

核心特性

  • 超过 60 项标准学术基准测试,涵盖数百个子任务
  • 支持 transformers、vLLM、GPT-NeoX 等多种推理后端
  • 支持 OpenAI、Anthropic 等商业 API 模型评估
  • 基于公开提示确保可复现性和跨论文可比性
  • 支持 LoRA 等 PEFT 适配器评估
  • 轻量安装,模型后端按需独立安装

适用场景

💡 大语言模型性能基准对比
💡 模型发布前的质量评估
💡 学术论文中的模型评测
💡 企业内部模型选型和对比
💡 Open LLM Leaderboard 排行榜评测

快速开始

克隆仓库后运行 pip install -e . 安装基础框架。使用 pip install "lm_eval[hf]" 安装 HuggingFace 后端,然后运行 lm_eval --model hf --model_args pretrained=EleutherAI/gpt-j-6B --tasks hellaswag --device cuda:0 执行评测。

相关项目