Promptfoo

活跃
GitHub TypeScript MIT

简介

LLM 提示和 Agent 测试评估工具,用于测试提示词、Agent 和 RAG 管道,内置红队测试和安全评估功能。

核心特性

  • 自动化 LLM 评测 — 批量测试提示词、模型和 RAG 管道的输出质量
  • 红队安全测试 — 内置漏洞扫描和对抗性测试,发现 LLM 应用的安全风险
  • 多模型对比 — 并排比较 OpenAI、Anthropic、Azure、Bedrock、Ollama 等模型表现
  • CI/CD 集成 — 自动化检查流程,将 LLM 评测集成到持续集成管道中
  • 代码扫描 — 审查 PR 中与 LLM 相关的安全和合规问题
  • 结果共享 — 支持将评测结果分享给团队成员进行协作分析

适用场景

💡 在生产环境部署前评估 LLM 提示词质量
💡 对 AI 应用进行红队安全测试发现潜在漏洞
💡 在多个 LLM 提供商之间选择最适合的模型
💡 建立 LLM 应用的持续回归测试基线

优势与不足

优势

  • 活跃维护,近期持续更新
  • 社区热度高(24.9k stars)
  • 开源许可证友好(MIT)
  • 项目有一定历史沉淀(已维护 3 年)

快速开始

npm install -g promptfoo
export OPENAI_API_KEY=sk-xxx
promptfoo init --example getting-started
cd getting-started
promptfoo eval
promptfoo view

相关项目

Giskard

5.8k · Python
活跃 A+

开源 LLM Agent 评估与测试库,提供自动化模型扫描、偏见检测、性能基准测试和合规检查,帮助团队在部署前全面验证 AI Agent 质量。

evaluationtestingllm-safety +3
  • · Scenario API 用于创建评估测试非确定性 LLM 输出
  • · 内置检查项包括 Groundedness、Conformity 和 LLM-as-Judge 评估
  • · 红队漏洞扫描器自动生成覆盖 OWASP LLM Top-10 类别的对抗性测试套件

Agent Governance Toolkit

6.2k · Python
活跃 A

微软推出的 AI 智能体治理工具包,提供策略执行、零信任身份验证、执行沙箱和可靠性工程,覆盖 OWASP 智能体 Top 10 全部安全风险。

securityevaluationpython +2
  • · 确定性策略执行引擎:在模型输出到达工具调用前拦截并评估所有操作,通过 YAML 策略文件定义允许/拒绝/需审批的规则,被拒绝的操作在结构上不可能执行
  • · 零信任身份与审计追溯:为每个 Agent 分配唯一身份(DID),每次操作生成防篡改的审计记录,包含生效策略、请求内容和决策原因
  • · 多语言 SDK 支持:提供 Python、TypeScript、.NET、Rust、Go 五种语言的 SDK,统一的策略评估接口覆盖主流开发栈

Agentic Security

2.0k · Python
活跃 A

开源的 LLM 漏洞扫描器和 AI 红队工具包,支持对 LLM 应用进行自动化安全模糊测试,检测越狱、提示注入和对抗性攻击等风险。

llm-securityred-teamingllm-fuzzer +2
  • · 支持文本、图像和音频的多模态攻击探测,全面测试 LLM 鲁棒性
  • · 多步骤越狱模拟,使用迭代攻击序列发现安全机制弱点
  • · 综合模糊测试引擎,通过随机输入对 LLM 进行压力测试发现边界情况

相关文章