Giskard

活跃
GitHub Python Apache-2.0

简介

开源 LLM Agent 评估与测试库,提供自动化模型扫描、偏见检测、性能基准测试和合规检查,帮助团队在部署前全面验证 AI Agent 质量。

核心特性

  • Scenario API 用于创建评估测试非确定性 LLM 输出
  • 内置检查项包括 Groundedness、Conformity 和 LLM-as-Judge 评估
  • 红队漏洞扫描器自动生成覆盖 OWASP LLM Top-10 类别的对抗性测试套件
  • 多轮对话测试支持完整的 Agent 对话评估
  • 模块化 v3 架构包含专注的包:giskard-checks、giskard-scan 和规划中的 giskard-rag
  • 异步优先设计,依赖轻量,便于 CI/CD 集成

适用场景

💡 在模型或提示变更后通过自动化评估套件捕获回归
💡 验证 RAG 质量,检查回答是否基于检索上下文
💡 对 AI Agent 进行红队测试,识别提示注入、数据泄露和偏见漏洞
💡 从知识库为 RAG 应用生成评估数据集
💡 通过对 Agent 输出的一致性检查来执行内容安全策略

快速开始

pip install giskard-checks && pip install giskard-scan

相关项目

相关文章