Garak
活跃简介
NVIDIA 开源的 LLM 漏洞扫描器,可自动检测大语言模型中的安全漏洞、幻觉倾向、越狱风险和提示注入等安全问题,是 LLM 安全评估的核心工具。
核心特性
- 自动扫描 LLM 漏洞,检测幻觉、数据泄露、提示注入和越狱攻击
- 结合静态、动态和自适应探针进行全面安全评估
- 广泛支持 LLM:Hugging Face、OpenAI、AWS Bedrock、Replicate、llama.cpp 及 REST 接口模型
- 可扩展插件系统,包含编码攻击、DAN 越狱、毒性、虚假信息等探针族
- 详细报告输出失败率、JSONL 日志和内置分析脚本
- 基于 CLI 的工具,类似 nmap/Metasploit,专为 LLM 安全测试设计
适用场景
快速开始
安装:pip install -U garak。扫描模型:garak --target_type huggingface --target_name gpt2 --probes dan.Dan_11_0。使用 --list_probes 查看所有可用探针。