Purple Llama

活跃
GitHub Python NOASSERTION

简介

Meta 推出的 LLM 安全评估工具集,提供安全基准测试、提示注入检测和输出审核等功能,帮助评估和提升大型语言模型的安全性。

核心特性

  • Llama Guard 模型用于输入/输出内容审核和安全过滤
  • Prompt Guard 检测和阻止提示注入与越狱攻击
  • Code Shield 在推理时过滤 LLM 生成的不安全代码
  • CyberSec Eval v1/v2/v3 基准测试评估 LLM 网络安全风险
  • 通过 Llama 3.2 支持 7 种新语言和 128K 上下文窗口
  • 评估工具采用 MIT 许可证,模型采用 Llama 社区许可证

适用场景

💡 为 LLM 应用添加安全护栏,防止有害输出
💡 在生产部署前评估 LLM 的网络安全风险
💡 过滤 AI 编码助手的不安全代码建议
💡 构建生成式 AI 红蓝对抗评估流水线

快速开始

通过 llama-recipes 仓库安装。从 Hugging Face 加载 Llama Guard 模型用于内容过滤。从 Purple Llama 仓库运行 CyberSec Eval 基准测试。通过提供的 Notebook 集成 Code Shield。所有组件均在 Hugging Face 上以 Llama 社区许可证提供。

相关项目