🛡️

安全护栏

AI 安全评估、红队测试、LLM 防护栏、漏洞扫描与合规审计工具,覆盖 NeMo Guardrails、Guardrails AI、Prompt 注入防御等项目,帮助开发者构建可信赖的 Agent 应用。

63 个项目

(24 / 63)

相关文章

Agent 评估LLM 评测自动化测试

Agent 评估与测试体系:从单轮评分到端到端流水线

大多数团队靠"看起来对了"来判断 Agent 质量。真正的评估需要三层指标、不腐烂的数据集、以及不会什么都同意的评判器。本文给出可运行的代码和可落地的决策框架。

RAGhallucination-detectionagent-evaluation

Agent 幻觉防御:超越护栏的实用缓解模式

LLM Agent 为什么会产生幻觉?本文从根本原因出发,系统梳理检索增强、置信度评分、多智能体交叉验证、来源强制回溯等实用缓解模式,并介绍如何用 UpTrain、Giskard、RagaAI Catalyst、Comet Opik、NVIDIA Garak 等工具构建可观测的幻觉防御体系。

安全Prompt InjectionOWASP

Agent 提示词注入防御:OWASP LLM01 七层纵深防护

基于 OWASP LLM Top 10 工程实践,系统讲解 Agent 提示词注入的七层纵深防御:输入清洗、指令隔离、最小权限、输出审计、护栏框架、持续红队评估和 Kill Switch,给出可落地的代码与工具链。

security-guardrailsred-teamprompt-injection

AI Agent 安全护栏与红队测试实战:从规则引擎到对抗评估

五层防御 + 红队闭环,5 个开源项目落地可复制方案,避开 prompt 越狱与 PII 泄露。

AI Agent安全Prompt Injection

AI Agent 安全攻防实战:从 Prompt 注入到纵深防御

系统梳理 AI Agent 面临的三大攻击面,结合实战代码讲解提示注入防御、工具权限隔离和输出过滤的纵深防御策略。

AI 编程Coding AgentCLI

AI 编程 Agent 深度对比:从 CLI 到 IDE 内嵌的架构取舍

从 CLI-first、IDE-集成到完全自主三种架构出发,对比七款主流编程 Agent 的上下文管理、工具访问和自主度,帮你为每个开发场景选对工具。