Guardrails AI

活跃
GitHub Python Apache-2.0

简介

Guardrails AI 为大语言模型添加可编程的安全护栏,通过输入输出验证、结构化数据提取和自定义校验器确保 LLM 应用的可靠性和安全性。

核心特性

  • Input/Output Guard 输入输出护栏:检测、量化和缓解 LLM 特定风险
  • Guardrails Hub 预构建验证器生态:RegexMatch、CompetitorCheck、ToxicLanguage 等开箱即用
  • Pydantic 结构化输出:通过函数调用或 prompt 优化强制 LLM 输出指定格式
  • 多验证器组合 Guard:一个 Guard 内可串联多个校验规则
  • Guardrails Server 模式:Flask 服务化,REST API + OpenAI SDK 兼容接口
  • Guardrails Index 基准:24 个护栏在 6 大类别的性能和延迟对比评测

适用场景

💡 在客服系统中部署 Output Guard 过滤有毒、歧视或泄露竞品信息的回复
💡 用 Pydantic Guard 从 LLM 提取结构化数据(如用户信息、产品属性)
💡 通过 Guardrails Server 为团队提供统一的 LLM 安全校验微服务
💡 在 Agent 工作流中对每一步的输入输出进行合规性检查
💡 构建 Content Moderation 管道,同时检测毒性语言和竞品提及

优势与不足

优势

  • 活跃维护,近期持续更新
  • 社区热度高(7.4k stars)
  • 开源许可证友好(Apache-2.0)
  • 项目有一定历史沉淀(已维护 3 年)

快速开始

pip install guardrails-ai,guardrails configure 配置 CLI,guardrails hub install hub://guardrails/regex_match 安装验证器,然后在代码中 Guard().use(RegexMatch(...)).validate(input) 即可使用。

相关项目

UQLM

1.2k · Python
活跃 A+

CVS Health 开源的 LLM 不确定性量化库,用于基于 UQ 的幻觉检测,提供置信度评分和幻觉缓解工具,帮助识别和降低 LLM 输出的不可靠内容。

hallucination-detectionuncertainty-quantificationllm-evaluation +2
  • · 提供五类不确定性量化评分器:Black-Box(一致性)、White-Box(Token 概率)、LLM-as-a-Judge、Ensemble 和 Long-Text
  • · Black-Box 评分器通过多次生成和比较测量响应一致性,兼容任何 LLM,开箱即用
  • · White-Box 评分器利用 Token 概率估算不确定性,单次生成即可评分,速度快成本低

OpenAI Evals

19.4k · Python
不活跃 B

OpenAI 推出的 LLM 评估框架,提供标准化的基准测试注册表和工具集,用于系统评估大语言模型和 LLM 系统的性能表现。

llm-evaluationbenchmarkevals +2
  • · 开源评估注册表,用于测试 LLM 性能的不同维度
  • · 使用基本和模型评分模板创建自定义评估,无需编写代码
  • · 支持私有评估,在不暴露数据的情况下评估工作流中的 LLM 模式

Giskard

5.8k · Python
活跃 A+

开源 LLM Agent 评估与测试库,提供自动化模型扫描、偏见检测、性能基准测试和合规检查,帮助团队在部署前全面验证 AI Agent 质量。

evaluationtestingllm-safety +3
  • · Scenario API 用于创建评估测试非确定性 LLM 输出
  • · 内置检查项包括 Groundedness、Conformity 和 LLM-as-Judge 评估
  • · 红队漏洞扫描器自动生成覆盖 OWASP LLM Top-10 类别的对抗性测试套件

相关文章