Purple Llama
活跃简介
Meta 推出的 LLM 安全评估工具集,提供安全基准测试、提示注入检测和输出审核等功能,帮助评估和提升大型语言模型的安全性。
核心特性
- Llama Guard 模型用于输入/输出内容审核和安全过滤
- Prompt Guard 检测和阻止提示注入与越狱攻击
- Code Shield 在推理时过滤 LLM 生成的不安全代码
- CyberSec Eval v1/v2/v3 基准测试评估 LLM 网络安全风险
- 通过 Llama 3.2 支持 7 种新语言和 128K 上下文窗口
- 评估工具采用 MIT 许可证,模型采用 Llama 社区许可证
适用场景
💡 为 LLM 应用添加安全护栏,防止有害输出
💡 在生产部署前评估 LLM 的网络安全风险
💡 过滤 AI 编码助手的不安全代码建议
💡 构建生成式 AI 红蓝对抗评估流水线
快速开始
通过 llama-recipes 仓库安装。从 Hugging Face 加载 Llama Guard 模型用于内容过滤。从 Purple Llama 仓库运行 CyberSec Eval 基准测试。通过提供的 Notebook 集成 Code Shield。所有组件均在 Hugging Face 上以 Llama 社区许可证提供。