Giskard

活跃
GitHub Python Apache-2.0

简介

开源 LLM Agent 评估与测试库,提供自动化模型扫描、偏见检测、性能基准测试和合规检查,帮助团队在部署前全面验证 AI Agent 质量。

核心特性

  • Scenario API 用于创建评估测试非确定性 LLM 输出
  • 内置检查项包括 Groundedness、Conformity 和 LLM-as-Judge 评估
  • 红队漏洞扫描器自动生成覆盖 OWASP LLM Top-10 类别的对抗性测试套件
  • 多轮对话测试支持完整的 Agent 对话评估
  • 模块化 v3 架构包含专注的包:giskard-checks、giskard-scan 和规划中的 giskard-rag
  • 异步优先设计,依赖轻量,便于 CI/CD 集成

适用场景

💡 在模型或提示变更后通过自动化评估套件捕获回归
💡 验证 RAG 质量,检查回答是否基于检索上下文
💡 对 AI Agent 进行红队测试,识别提示注入、数据泄露和偏见漏洞
💡 从知识库为 RAG 应用生成评估数据集
💡 通过对 Agent 输出的一致性检查来执行内容安全策略

优势与不足

优势

  • 活跃维护,近期持续更新
  • 社区热度高(5.8k stars)
  • 开源许可证友好(Apache-2.0)
  • 项目有一定历史沉淀(已维护 4 年)

快速开始

pip install giskard-checks && pip install giskard-scan

相关项目

Agent Governance Toolkit

6.2k · Python
活跃 A

微软推出的 AI 智能体治理工具包,提供策略执行、零信任身份验证、执行沙箱和可靠性工程,覆盖 OWASP 智能体 Top 10 全部安全风险。

securityevaluationpython +2
  • · 确定性策略执行引擎:在模型输出到达工具调用前拦截并评估所有操作,通过 YAML 策略文件定义允许/拒绝/需审批的规则,被拒绝的操作在结构上不可能执行
  • · 零信任身份与审计追溯:为每个 Agent 分配唯一身份(DID),每次操作生成防篡改的审计记录,包含生效策略、请求内容和决策原因
  • · 多语言 SDK 支持:提供 Python、TypeScript、.NET、Rust、Go 五种语言的 SDK,统一的策略评估接口覆盖主流开发栈

Promptfoo

24.9k · TypeScript
活跃 A

LLM 提示和 Agent 测试评估工具,用于测试提示词、Agent 和 RAG 管道,内置红队测试和安全评估功能。

testingevaluationred-teaming +2
  • · 自动化 LLM 评测 — 批量测试提示词、模型和 RAG 管道的输出质量
  • · 红队安全测试 — 内置漏洞扫描和对抗性测试,发现 LLM 应用的安全风险
  • · 多模型对比 — 并排比较 OpenAI、Anthropic、Azure、Bedrock、Ollama 等模型表现

LLM Guard

3.2k · Python
正常 A

LLM 交互安全工具包,提供提示词注入检测、敏感信息脱敏、内容安全审计等防护能力,保障生产环境 LLM 调用的安全性。

securityllmpython +2
  • · 全面的提示词扫描器:提示词注入检测、毒性检测、敏感信息检测、情感分析等
  • · 输出扫描器:偏见检测、事实一致性、恶意 URL 检测和敏感数据过滤
  • · PII 匿名化与反匿名化,防止数据泄露

相关文章