📊

可观测性

AI Agent 监控、追踪与评估工具,包括 Langfuse、LangSmith、OpenTelemetry 等,提供 token 用量、调用链、延迟、成本与质量评估,保障 Agent 在生产环境的稳定运行。

111 个项目

Kong

44.0k · Lua
活跃 A+

云原生 API 和 AI 网关,支持 LLM 请求路由、速率限制、负载均衡和可观测性,是 AI Agent 应用的关键基础设施。

observabilityapiagent +2
  • · API 流量管理 — 高级路由、负载均衡、健康检查,支持 RESTful Admin API 和声明式配置
  • · AI Gateway 能力 — 统一 LLM API 路由,支持 OpenAI、Anthropic、Gemini、Bedrock 等多提供商
  • · MCP 流量治理 — MCP 安全、可观测性,以及从 REST API 自动生成 MCP 接口

PostHog

37.7k · Python
活跃 B

PostHog 是面向 AI Agent 与自驱动产品的全栈可观测平台,集成分析、会话回放、特性开关与错误追踪。

analyticssession-replayfeature-flags +3
  • · AI 可观测性 — 专门为 AI Agent 设计的 trace、token 用量与诊断面板
  • · 会话回放 — 记录 Agent 执行的完整事件流,支持重放与调试
  • · 特性开关与实验 — A/B 实验与渐进式发布,与 Agent 行为联动

Langfuse

33.2k · TypeScript
活跃 A

开源 LLM 可观测性平台,提供追踪、评估、提示管理和数据集管理功能,支持 LangChain、OpenAI、Anthropic 等主流框架的集成。

observabilitytracingllm-evaluation +2
  • · LLM 可观测性追踪 — 追踪 LLM 调用、检索、嵌入、Agent 动作等完整链路,支持用户会话级调试
  • · 提示词版本管理 — 中心化管理、版本控制和协作迭代提示词,服务端/客户端缓存零延迟切换
  • · 评估管线 — 支持 LLM-as-a-Judge、代码评估、用户反馈收集和自定义评估管道

Prompt Optimizer

33.1k · TypeScript
活跃 A+

一款 AI 提示词优化工具,帮助用户编写更高质量的提示词,从而获得更好的 AI 输出效果。

prompt-engineeringevaluationllm +2
  • · 一键智能优化 — 输入简单提示词,AI 自动生成优化版本,支持多轮迭代改进
  • · 双模式优化 — 支持系统提示词和用户提示词两种优化模式,适配不同使用场景
  • · 多模型集成 — 支持 OpenAI、Gemini、DeepSeek、Grok、智谱 AI、SiliconFlow 等主流模型

MLflow

27.5k · Python
活跃 A

MLflow 是开源 AI 工程平台,为 Agent 和 LLM 应用提供调试、评估、监控和优化能力,支持模型与数据访问管理。

mlflowllmopsevaluation +2
  • · LLM可观测性 — 基于OpenTelemetry捕获Agent和LLM应用的完整调用链
  • · 系统评估 — 50+内置指标和LLM Judge,自动评估模型输出质量
  • · Prompt注册与优化 — 版本管理Prompt,支持自动优化算法改进性能

12 Factor Agents

25.3k · TypeScript
不活跃 B

探讨构建生产级 LLM 驱动软件的核心原则,总结出使智能体应用达到生产可用标准的十二个关键要素。

agentframeworkevaluation +2
  • · 12 条核心原则体系 — 从自然语言到工具调用、上下文窗口管理、状态无 Reducer 等系统性最佳实践
  • · 上下文窗口自主管理(Factor 3)— 自行构建和管理 LLM 上下文,而非依赖框架黑盒
  • · 工具即结构化输出(Factor 4)— 将工具调用视为结构化输出,简化 Agent 交互模式

Promptfoo

24.3k · TypeScript
活跃 A

LLM 提示和 Agent 测试评估工具,用于测试提示词、Agent 和 RAG 管道,内置红队测试和安全评估功能。

testingevaluationred-teaming +2
  • · 自动化 LLM 评测 — 批量测试提示词、模型和 RAG 管道的输出质量
  • · 红队安全测试 — 内置漏洞扫描和对抗性测试,发现 LLM 应用的安全风险
  • · 多模型对比 — 并排比较 OpenAI、Anthropic、Azure、Bedrock、Ollama 等模型表现

Opik

21.4k · Python
活跃 A+

Opik 是一个开源的 LLM 应用可观测性平台,提供 Agent 追踪、评估测试、提示词实验管理等功能,帮助开发者监控和优化 AI Agent 系统。

observabilityllm-evaluationtracing +2
  • · 全面的 LLM 可观测性,深度追踪调用、对话和 Agent 活动
  • · LLM-as-a-judge 指标,用于幻觉检测、内容审核和 RAG 评估
  • · 生产就绪的监控仪表板,支持每天 4000 万+ 追踪的规模

Agents Towards Production

21.3k · Jupyter Notebook
活跃 A+

端到端的代码优先教程,教授如何构建生产级 GenAI 智能体,涵盖从原型到企业级部署的完整流程。

agentframeworkevaluation +2
  • · 28 个生产级教程 — 涵盖有状态工作流、向量记忆、Web 搜索 API 等核心主题
  • · 端到端覆盖 — 从 Docker 部署、FastAPI 端点到安全防护、GPU 扩展
  • · 多智能体协调 — 教授多 Agent 协作架构设计与实现

OpenAI Evals

19.2k · Python
不活跃 B

OpenAI 推出的 LLM 评估框架,提供标准化的基准测试注册表和工具集,用于系统评估大语言模型和 LLM 系统的性能表现。

llm-evaluationbenchmarkevals +2
  • · 开源评估注册表,用于测试 LLM 性能的不同维度
  • · 使用基本和模型评分模板创建自定义评估,无需编写代码
  • · 支持私有评估,在不暴露数据的情况下评估工作流中的 LLM 模式

ccusage

18.0k · Rust
活跃 A+

ccusage 是一个用于分析编码 Agent CLI Token 使用量和成本的轻量工具,通过读取本地数据帮助开发者监控和优化 LLM API 消费。

token-usagecost-analysiscli +2
  • · 支持 15 种以上编码 Agent CLI 的统一报告,包括 Claude Code、Codex、OpenCode 和 Gemini
  • · 按日、周、月和会话聚合使用量,以 USD 追踪费用
  • · 支持 `--breakdown` 查看模型级别费用明细,追踪缓存 Token

DeepEval

17.6k · Python
活跃 A

DeepEval 是一个用于 LLM 应用的开源评估框架。提供丰富的评估指标和工具,支持单元测试、集成测试,帮助开发者构建可靠的 LLM 应用。

llmevaluationtesting +1
  • · 兼容 Pytest 的 LLM 评估框架,提供开箱即用的智能体、RAG 和聊天机器人评估指标
  • · 智能体指标包括任务完成度、工具正确性、步骤效率和计划遵循度
  • · RAG 指标涵盖答案相关性、忠实度、上下文召回/精确度/相关性和 RAGAS

RagaAI Catalyst

16.1k · Python
不活跃 B

RagaAI Catalyst 是面向 Agent AI 的可观测性、监控与评估框架,支持 Agent/LLM/工具链追踪、多 Agent 系统调试及自托管仪表盘分析。

observabilitytracingevaluation +2
  • · 全方位 LLM 项目管理:项目管理、数据集管理、评估管理、追踪管理、提示词管理一站式平台
  • · Agentic Tracing 模块:追踪 Agent/LLM/工具调用全链路,监控 token 用量和执行模式
  • · 内置多种评估指标(Faithfulness、Hallucination 等),支持自定义阈值和批量评估

Ragas

15.3k · Python
不活跃 B

Ragas 是一个用于评估 RAG(检索增强生成)系统的框架。提供多种评估指标,包括忠实度、答案相关性、上下文精确度等,帮助开发者优化 RAG 应用性能。

ragevaluationllm +1
  • · 基于 LLM 和传统方法的客观评估指标,精准衡量 LLM 应用质量
  • · 自动生成覆盖多种场景的测试数据集,专为 RAG 系统设计
  • · 无缝集成 LangChain、主流可观测性工具及热门 LLM 框架

OpenMetadata

14.9k · TypeScript
活跃 A

OpenMetadata 是面向数据和 AI 的统一元数据平台,提供数据资产发现、血缘、治理与 Agent 上下文检索能力。

observabilitymetadatadata-governance +2
  • · 统一元数据模型 — 表、字段、指标、dashboard、pipeline、ML 模型等一站式管理
  • · 自动血缘追踪 — 跨数据库、BI、orchestration 平台采集端到端数据血缘
  • · 数据质量 SLA — 内置数据质量测试框架,支持规则、SLA 告警与失败追踪

LM Evaluation Harness

13.7k · Python
活跃 A

EleutherAI 推出的大语言模型评估框架,提供标准化的少样本评测流水线,支持数百项基准任务,是 LLM 社区广泛采用的核心评测工具。

llm-evaluationbenchmarkevaluation-framework +2
  • · 超过 60 项标准学术基准测试,涵盖数百个子任务
  • · 支持 transformers、vLLM、GPT-NeoX 等多种推理后端
  • · 支持 OpenAI、Anthropic 等商业 API 模型评估

TensorZero

11.7k · Rust
正常 B

TensorZero 是开源 LLMOps 平台,统一 LLM 网关、可观测性、评估、优化与 A/B 测试,专为生产 Agent 设计。

observabilityllmllm-gateway +2
  • · 统一 LLM 网关 - 一套 API 接入 Anthropic、OpenAI、Bedrock、Gemini、vLLM 等 20+ 提供方
  • · 10k+ QPS 下 p99 延迟开销 < 1ms - Rust 核心面向生产吞吐优化
  • · 推理与反馈存储 - 数据存放在你自己的数据库中

Crucix

11.4k · JavaScript
正常 B

Crucix 是一个个人情报智能体,持续监控多个数据源,当检测到重要变化时主动通知用户,帮助用户实时掌握信息动态。

agentautomationmonitoring +2
  • · 聚合 27 个 OSINT 数据源:卫星火灾数据、航班追踪、辐射监测等
  • · Jarvis 风格的 3D WebGL 仪表盘,支持地球仪、平面地图和动态航线
  • · 集成 LLM 实现双向情报助手,支持 Telegram 和 Discord 推送告警

Weights & Biases

11.2k · Python
活跃 A

W&B 是面向机器学习与 LLM 应用的实验追踪、可视化与协作平台,支持 Agent 训练评估、超参管理与模型注册全流程。

observabilityexperiment-trackingmlops +2
  • · 实验追踪 — 自动记录超参、指标、系统资源与代码版本,支持实验对比与可视化
  • · W&B Models — 提供 artifacts 模型注册、版本管理与部署到生产的能力
  • · W&B Weave — LLM 与 Agent 专用 trace 工具,支持 prompt 评估、对话回放与质量评分

(24 / 111)

相关文章

Agent 评估LLM 评测自动化测试

Agent 评估与测试体系:从单轮评分到端到端流水线

大多数团队靠"看起来对了"来判断 Agent 质量。真正的评估需要三层指标、不腐烂的数据集、以及不会什么都同意的评判器。本文给出可运行的代码和可落地的决策框架。

RAGhallucination-detectionagent-evaluation

Agent 幻觉防御:超越护栏的实用缓解模式

LLM Agent 为什么会产生幻觉?本文从根本原因出发,系统梳理检索增强、置信度评分、多智能体交叉验证、来源强制回溯等实用缓解模式,并介绍如何用 UpTrain、Giskard、RagaAI Catalyst、Comet Opik、NVIDIA Garak 等工具构建可观测的幻觉防御体系。

可观测性OpenTelemetryLLMOps

Agent 可观测性深度实战:从 OpenTelemetry 到生产 trace 体系

把多步 Agent 推理装进 OpenTelemetry 语义规范:从 OpenLLMetry 入手,建立层级化 Span 关联模型、token 成本归因、检索质量指标和分层告警体系,让 Agent 从黑盒变成可信赖的基础设施。

AI Agent可观测性链路追踪

Agent 可观测性体系构建:从链路追踪到自动评估

系统讲解 Agent 可观测性的三大支柱——链路追踪、指标监控和自动评估,帮你构建生产级 Agent 监控体系。

安全Prompt InjectionOWASP

Agent 提示词注入防御:OWASP LLM01 七层纵深防护

基于 OWASP LLM Top 10 工程实践,系统讲解 Agent 提示词注入的七层纵深防御:输入清洗、指令隔离、最小权限、输出审计、护栏框架、持续红队评估和 Kill Switch,给出可落地的代码与工具链。

rate limitingcost controlprompt injection

Agent 速率限制与成本攻击防御:Token 配额、滑动窗口、攻击向量实战

系统讲解 LLM Agent 在生产环境中的速率限制(Rate Limiting)与成本攻击(Cost Attack)防御:从单用户 Token 配额、多租户滑动窗口、Prompt 注入放大成本,到 DDoS 防护与 LangChain/CrewAI/AutoGen 框架的集成。