Inspect AI

活跃
GitHub Python MIT

简介

英国 AI 安全研究所(AISI)开源的大语言模型评估框架,提供全面的模型能力评估工具,支持安全性和对齐性测试。

核心特性

  • 由英国 AI 安全研究所(AISI)创建的全面 LLM 评估框架
  • 200+ 种预构建评估,可直接在任何模型上运行进行能力评估
  • 内置提示工程、工具使用、多轮对话和模型评分评估
  • 可扩展架构,通过 Python 包插件支持新的 elicitation 和评分技术
  • Web UI 前端使用 TypeScript/React 可视化评估结果
  • 完整的 CLI 和 Python API 用于编程式评估编排

适用场景

💡 在安全、对齐和任务性能维度上基准测试和比较 LLM 能力
💡 政府和企业在生产部署前进行 AI 安全测试
💡 运行标准化评估以检测模型回归和能力漂移
💡 研究机构进行可重复的 AI 能力评估
💡 使用可扩展插件系统构建自定义评估套件

快速开始

1. 克隆仓库:git clone https://github.com/UKGovernmentBEIS/inspect_ai.git && cd inspect_ai
2. 安装:pip install -e ".[dev]" 或 uv sync --extra dev
3. 运行评估:inspect eval <eval-path> --model <model>
4. 浏览 200+ 种预构建评估:https://inspect.aisi.org.uk/evals/
5. 文档:https://inspect.aisi.org.uk/

相关项目