HELM
活跃简介
HELM(Holistic Evaluation of Language Models)是斯坦福大学 CRFM 推出的语言模型综合评估框架,支持对大语言模型和多模态模型进行全面、可复现、透明的评估。
核心特性
- 标准化基准测试,包括 MMLU-Pro、GPQA、IFEval、WildBench
- 统一接口评估 OpenAI、Anthropic、Google 等厂商模型
- 超越准确率的指标 — 效率、偏见、毒性、公平性
- 用于检查单个提示和模型响应的 Web UI
- 能力、安全性和视觉语言模型的官方排行榜
适用场景
💡 将新 LLM 发布与已有基线进行基准测试
💡 在安全和偏见维度上比较模型性能
💡 复现研究论文中发布的评估结果
💡 为企业模型选择构建内部排行榜
💡 在视觉语言任务上评估多模态模型
分类
快速开始
安装:`pip install crfm-helm`。运行基准测试:`helm-run --run-entries mmlu:subject=philosophy,model=openai/gpt2 --suite my-suite --max-eval-instances 10`。汇总结果:`helm-summarize --suite my-suite`。查看结果:`helm-server --suite my-suite` 然后打开 http://localhost:8000/。