Giskard
活跃简介
开源 LLM Agent 评估与测试库,提供自动化模型扫描、偏见检测、性能基准测试和合规检查,帮助团队在部署前全面验证 AI Agent 质量。
核心特性
- Scenario API 用于创建评估测试非确定性 LLM 输出
- 内置检查项包括 Groundedness、Conformity 和 LLM-as-Judge 评估
- 红队漏洞扫描器自动生成覆盖 OWASP LLM Top-10 类别的对抗性测试套件
- 多轮对话测试支持完整的 Agent 对话评估
- 模块化 v3 架构包含专注的包:giskard-checks、giskard-scan 和规划中的 giskard-rag
- 异步优先设计,依赖轻量,便于 CI/CD 集成
适用场景
💡 在模型或提示变更后通过自动化评估套件捕获回归
💡 验证 RAG 质量,检查回答是否基于检索上下文
💡 对 AI Agent 进行红队测试,识别提示注入、数据泄露和偏见漏洞
💡 从知识库为 RAG 应用生成评估数据集
💡 通过对 Agent 输出的一致性检查来执行内容安全策略
优势与不足
✅ 优势
- • 活跃维护,近期持续更新
- • 社区热度高(5.8k stars)
- • 开源许可证友好(Apache-2.0)
- • 项目有一定历史沉淀(已维护 4 年)
快速开始
pip install giskard-checks && pip install giskard-scan