Hugging Face Evaluate

活跃
GitHub Python Apache-2.0

简介

Hugging Face 官方模型与数据集评估库,提供丰富的评估指标和方法,轻松评估机器学习模型性能和数据集质量。

核心特性

  • 标准化指标库 — 通过 `load('accuracy')` 加载数十种常用指标,覆盖 NLP、CV 和数据集特定任务
  • 框架无关评估 — 无需修改代码即可跨 Numpy、Pandas、PyTorch、TensorFlow 和 JAX 使用
  • 类型安全输入 — 自动类型检查确保每个指标使用正确的输入格式
  • 指标卡片 — 每个指标附带文档,说明取值范围、限制条件和使用示例
  • Hub 生态集成 — 可将自定义评估模块发布到 Hugging Face Hub 与社区共享
  • CLI 指标创建 — 通过 `evaluate-cli create` 快速搭建新评估模块并推送到 Hub Spaces

适用场景

💡 在标准基准上比较多个 ML 模型的准确率、F1 和 BLEU 等指标
💡 使用测量模块评估数据集质量和偏差
💡 为特定领域的 NLP 或 CV 任务构建自定义评估流水线
💡 通过自动化指标报告进行 CI/CD 模型回归测试
💡 团队通过 Hub 共享指标的协作评估项目

快速开始

# 安装
pip install evaluate

# 使用
import evaluate
accuracy = evaluate.load('accuracy')
results = accuracy.compute(predictions=[1, 2, 3], references=[1, 2, 4])
print(results)

相关项目