Garak

活跃
GitHub Python Apache-2.0

简介

NVIDIA 开源的 LLM 漏洞扫描器,可自动检测大语言模型中的安全漏洞、幻觉倾向、越狱风险和提示注入等安全问题,是 LLM 安全评估的核心工具。

核心特性

  • 自动扫描 LLM 漏洞,检测幻觉、数据泄露、提示注入和越狱攻击
  • 结合静态、动态和自适应探针进行全面安全评估
  • 广泛支持 LLM:Hugging Face、OpenAI、AWS Bedrock、Replicate、llama.cpp 及 REST 接口模型
  • 可扩展插件系统,包含编码攻击、DAN 越狱、毒性、虚假信息等探针族
  • 详细报告输出失败率、JSONL 日志和内置分析脚本
  • 基于 CLI 的工具,类似 nmap/Metasploit,专为 LLM 安全测试设计

适用场景

💡 生产部署前对 LLM 应用进行安全审计
💡 红队演练以识别 AI 模型防御中的薄弱环节
💡 针对幻觉和虚假信息生成风险的合规测试
💡 对已部署语言模型进行持续漏洞监控

快速开始

安装:pip install -U garak。扫描模型:garak --target_type huggingface --target_name gpt2 --probes dan.Dan_11_0。使用 --list_probes 查看所有可用探针。

相关项目

相关文章