📊

最佳可观测性 Top 20

精选 20 个最受欢迎的开源可观测性项目,按 GitHub Stars 排名。

1

Netdata

80.2k Stars

Netdata 是开源实时可观测性平台,秒级指标、AI 健康检查与零配置部署,被广泛用于 AI Agent 服务的运行时监控。

monitoringmetricsreal-timeagent
2

Kong

44.0k Stars

云原生 API 和 AI 网关,支持 LLM 请求路由、速率限制、负载均衡和可观测性,是 AI Agent 应用的关键基础设施。

observabilityapiagentlua
3

PostHog

37.7k Stars

PostHog 是面向 AI Agent 与自驱动产品的全栈可观测平台,集成分析、会话回放、特性开关与错误追踪。

analyticssession-replayfeature-flagsai-observability
4

Langfuse

33.2k Stars

开源 LLM 可观测性平台,提供追踪、评估、提示管理和数据集管理功能,支持 LangChain、OpenAI、Anthropic 等主流框架的集成。

observabilitytracingllm-evaluationprompt-management
5

Prompt Optimizer

33.1k Stars

一款 AI 提示词优化工具,帮助用户编写更高质量的提示词,从而获得更好的 AI 输出效果。

prompt-engineeringevaluationllmtypescript
6

SigNoz

31.9k Stars

SigNoz 是 OpenTelemetry 原生的开源可观测平台,提供 APM、日志、指标与告警一体化能力。

opentelemetrytracinglogsmetrics
7

MLflow LLMOps

27.5k Stars

MLflow 的 LLM / GenAI 扩展,提供 prompt 版本管理 / evaluation / model registry / tracing 一站式 LLMOps。

mlopsevaluationmodel-registry
8

MLflow

27.5k Stars

MLflow 是开源 AI 工程平台,为 Agent 和 LLM 应用提供调试、评估、监控和优化能力,支持模型与数据访问管理。

mlflowllmopsevaluationobservability
9

12 Factor Agents

25.3k Stars

探讨构建生产级 LLM 驱动软件的核心原则,总结出使智能体应用达到生产可用标准的十二个关键要素。

agentframeworkevaluationobservability
10

Promptfoo

24.3k Stars

LLM 提示和 Agent 测试评估工具,用于测试提示词、Agent 和 RAG 管道,内置红队测试和安全评估功能。

testingevaluationred-teamingprompt-testing
11

Opik

21.4k Stars

Opik 是一个开源的 LLM 应用可观测性平台,提供 Agent 追踪、评估测试、提示词实验管理等功能,帮助开发者监控和优化 AI Agent 系统。

observabilityllm-evaluationtracingprompt-testing
12

Agents Towards Production

21.3k Stars

端到端的代码优先教程,教授如何构建生产级 GenAI 智能体,涵盖从原型到企业级部署的完整流程。

agentframeworkevaluationobservability
13

openobserve

21.1k Stars

OpenObserve 是面向日志、指标、追踪、LLM 可观测性的开源平台,单二进制部署,是 Agent 与 RAG 系统的高性价比数据后端。

observabilitylogsmetricstracing
14

OpenAI Evals

19.2k Stars

OpenAI 推出的 LLM 评估框架,提供标准化的基准测试注册表和工具集,用于系统评估大语言模型和 LLM 系统的性能表现。

llm-evaluationbenchmarkevalsred-teaming
15

ccusage

18.0k Stars

ccusage 是一个用于分析编码 Agent CLI Token 使用量和成本的轻量工具,通过读取本地数据帮助开发者监控和优化 LLM API 消费。

token-usagecost-analysisclirust
16

DeepEval

17.6k Stars

DeepEval 是一个用于 LLM 应用的开源评估框架。提供丰富的评估指标和工具,支持单元测试、集成测试,帮助开发者构建可靠的 LLM 应用。

llmevaluationtestingrag
17

RagaAI Catalyst

16.1k Stars

RagaAI Catalyst 是面向 Agent AI 的可观测性、监控与评估框架,支持 Agent/LLM/工具链追踪、多 Agent 系统调试及自托管仪表盘分析。

observabilitytracingevaluationagent-monitoring
18

Ragas

15.3k Stars

Ragas 是一个用于评估 RAG(检索增强生成)系统的框架。提供多种评估指标,包括忠实度、答案相关性、上下文精确度等,帮助开发者优化 RAG 应用性能。

ragevaluationllmtesting
19

OpenMetadata

14.9k Stars

OpenMetadata 是面向数据和 AI 的统一元数据平台,提供数据资产发现、血缘、治理与 Agent 上下文检索能力。

observabilitymetadatadata-governancelineage
20

LM Evaluation Harness

13.7k Stars

EleutherAI 推出的大语言模型评估框架,提供标准化的少样本评测流水线,支持数百项基准任务,是 LLM 社区广泛采用的核心评测工具。

llm-evaluationbenchmarkevaluation-frameworklanguage-model

相关文章