Rebuff

不活跃
GitHub TypeScript Apache-2.0

简介

针对 LLM 的提示词注入检测器,结合启发式规则、向量相似度和语言模型多重防御策略,有效识别和阻止恶意提示注入攻击。

核心特性

  • 四层防御策略的多层提示词注入检测
  • 启发式过滤,在 LLM 处理前拦截明显恶意输入
  • 基于 LLM 的分析,使用专用模型识别复杂攻击
  • 向量数据库驱动的已知攻击模式识别
  • 金丝雀令牌系统检测提示词泄露并防止数据外泄
  • 自强化设计,从检测到的攻击中学习以预防未来攻击

适用场景

💡 保护 LLM 应用免受提示词注入漏洞攻击
💡 为面向客户的 AI 聊天机器人添加安全防护
💡 检测和防止 AI 系统中的越狱尝试
💡 构建具有可审计输入验证的合规 AI 应用
💡 研究和测试提示词注入攻击向量

快速开始

1. 安装:pip install rebuff
2. 导入:from rebuff import RebuffSdk
3. 创建实例:rb = RebuffSdk(openai_apikey, pinecone_apikey, pinecone_index)
4. 检测输入:result = rb.detect_injection(user_input)
5. 使用金丝雀:buffed_prompt, canary_word = rb.add_canary_word(prompt_template)

相关项目

相关文章