Rebuff
不活跃简介
针对 LLM 的提示词注入检测器,结合启发式规则、向量相似度和语言模型多重防御策略,有效识别和阻止恶意提示注入攻击。
核心特性
- 四层防御策略的多层提示词注入检测
- 启发式过滤,在 LLM 处理前拦截明显恶意输入
- 基于 LLM 的分析,使用专用模型识别复杂攻击
- 向量数据库驱动的已知攻击模式识别
- 金丝雀令牌系统检测提示词泄露并防止数据外泄
- 自强化设计,从检测到的攻击中学习以预防未来攻击
适用场景
💡 保护 LLM 应用免受提示词注入漏洞攻击
💡 为面向客户的 AI 聊天机器人添加安全防护
💡 检测和防止 AI 系统中的越狱尝试
💡 构建具有可审计输入验证的合规 AI 应用
💡 研究和测试提示词注入攻击向量
快速开始
1. 安装:pip install rebuff
2. 导入:from rebuff import RebuffSdk
3. 创建实例:rb = RebuffSdk(openai_apikey, pinecone_apikey, pinecone_index)
4. 检测输入:result = rb.detect_injection(user_input)
5. 使用金丝雀:buffed_prompt, canary_word = rb.add_canary_word(prompt_template)