Giskard
活跃简介
开源 LLM Agent 评估与测试库,提供自动化模型扫描、偏见检测、性能基准测试和合规检查,帮助团队在部署前全面验证 AI Agent 质量。
核心特性
- Scenario API 用于创建评估测试非确定性 LLM 输出
- 内置检查项包括 Groundedness、Conformity 和 LLM-as-Judge 评估
- 红队漏洞扫描器自动生成覆盖 OWASP LLM Top-10 类别的对抗性测试套件
- 多轮对话测试支持完整的 Agent 对话评估
- 模块化 v3 架构包含专注的包:giskard-checks、giskard-scan 和规划中的 giskard-rag
- 异步优先设计,依赖轻量,便于 CI/CD 集成
适用场景
💡 在模型或提示变更后通过自动化评估套件捕获回归
💡 验证 RAG 质量,检查回答是否基于检索上下文
💡 对 AI Agent 进行红队测试,识别提示注入、数据泄露和偏见漏洞
💡 从知识库为 RAG 应用生成评估数据集
💡 通过对 Agent 输出的一致性检查来执行内容安全策略
快速开始
pip install giskard-checks && pip install giskard-scan