Garak

活跃
GitHub Python Apache-2.0

简介

NVIDIA 开源的 LLM 漏洞扫描器,可自动检测大语言模型中的安全漏洞、幻觉倾向、越狱风险和提示注入等安全问题,是 LLM 安全评估的核心工具。

核心特性

  • 自动扫描 LLM 漏洞,检测幻觉、数据泄露、提示注入和越狱攻击
  • 结合静态、动态和自适应探针进行全面安全评估
  • 广泛支持 LLM:Hugging Face、OpenAI、AWS Bedrock、Replicate、llama.cpp 及 REST 接口模型
  • 可扩展插件系统,包含编码攻击、DAN 越狱、毒性、虚假信息等探针族
  • 详细报告输出失败率、JSONL 日志和内置分析脚本
  • 基于 CLI 的工具,类似 nmap/Metasploit,专为 LLM 安全测试设计

适用场景

💡 生产部署前对 LLM 应用进行安全审计
💡 红队演练以识别 AI 模型防御中的薄弱环节
💡 针对幻觉和虚假信息生成风险的合规测试
💡 对已部署语言模型进行持续漏洞监控

优势与不足

优势

  • 活跃维护,近期持续更新
  • 社区热度高(9.1k stars)
  • 开源许可证友好(Apache-2.0)
  • 项目有一定历史沉淀(已维护 3 年)

快速开始

安装:pip install -U garak。扫描模型:garak --target_type huggingface --target_name gpt2 --probes dan.Dan_11_0。使用 --list_probes 查看所有可用探针。

相关项目

AI-Infra-Guard

6.2k · Python
活跃 A+

腾讯开源的全栈 AI 红队平台,集成 OpenClaw 安全扫描、Agent 扫描、Skills 扫描、MCP 扫描、AI 基础设施扫描及 LLM 越狱评估能力。

ai-securityred-teamingllm-security +2
  • · ClawScan:OpenClaw 安全扫描,检测 OpenClaw 配置和技能中的漏洞
  • · Agent Scan:跨 AI 代理的漏洞扫描,支持 WebSocket 代理提供商
  • · AI 基础设施漏洞扫描,覆盖 68+ AI 组件,包含 600+ CVE 规则

Agentic Security

2.0k · Python
活跃 A

开源的 LLM 漏洞扫描器和 AI 红队工具包,支持对 LLM 应用进行自动化安全模糊测试,检测越狱、提示注入和对抗性攻击等风险。

llm-securityred-teamingllm-fuzzer +2
  • · 支持文本、图像和音频的多模态攻击探测,全面测试 LLM 鲁棒性
  • · 多步骤越狱模拟,使用迭代攻击序列发现安全机制弱点
  • · 综合模糊测试引擎,通过随机输入对 LLM 进行压力测试发现边界情况

OpenAI Evals

19.4k · Python
不活跃 B

OpenAI 推出的 LLM 评估框架,提供标准化的基准测试注册表和工具集,用于系统评估大语言模型和 LLM 系统的性能表现。

llm-evaluationbenchmarkevals +2
  • · 开源评估注册表,用于测试 LLM 性能的不同维度
  • · 使用基本和模型评分模板创建自定义评估,无需编写代码
  • · 支持私有评估,在不暴露数据的情况下评估工作流中的 LLM 模式

相关文章