Arize Phoenix

活跃
GitHub Python NOASSERTION

简介

Phoenix 是面向 LLM 与 Agent 应用的开源观测与评估工具,支持在线追踪与离线诊断。

核心特性

  • 基于 OpenTelemetry 的 LLM 应用运行时可观测性追踪
  • LLM 驱动的评估,用于响应和检索质量基准测试
  • 版本化数据集,用于实验、评估和微调
  • 提示词管理,支持版本控制、标签和实验
  • Playground 用于优化提示词、对比模型和回放追踪调用
  • 内置 PXI Agent,用于调试追踪和导航 Phoenix

适用场景

💡 追踪和调试 LangChain、LlamaIndex、OpenAI SDK 的 LLM 调用
💡 使用内置评估工具评估 RAG 管道检索质量
💡 系统性地对比提示词版本和模型变体
💡 监控生产环境 LLM 性能并检测回归
💡 使用版本控制和 A/B 测试管理提示词库

优势与不足

优势

  • 活跃维护,近期持续更新
  • 社区热度高(11.1k stars)
  • 项目有一定历史沉淀(已维护 3 年)

⚠️ 不足

  • Issue 积压较多(925 个 open issues)
  • 缺少明确的开源许可证

快速开始

pip install arize-phoenix → import phoenix as px → px.launch_app() → 打开 http://localhost:6006 → 使用 OpenTelemetry 埋点 LLM 代码

相关项目

Opik

21.4k · Python
活跃 A+

Opik 是一个开源的 LLM 应用可观测性平台,提供 Agent 追踪、评估测试、提示词实验管理等功能,帮助开发者监控和优化 AI Agent 系统。

observabilityllm-evaluationtracing +2
  • · 全面的 LLM 可观测性,深度追踪调用、对话和 Agent 活动
  • · LLM-as-a-judge 指标,用于幻觉检测、内容审核和 RAG 评估
  • · 生产就绪的监控仪表板,支持每天 4000 万+ 追踪的规模

Langfuse

33.2k · TypeScript
活跃 A

开源 LLM 可观测性平台,提供追踪、评估、提示管理和数据集管理功能,支持 LangChain、OpenAI、Anthropic 等主流框架的集成。

observabilitytracingllm-evaluation +2
  • · LLM 可观测性追踪 — 追踪 LLM 调用、检索、嵌入、Agent 动作等完整链路,支持用户会话级调试
  • · 提示词版本管理 — 中心化管理、版本控制和协作迭代提示词,服务端/客户端缓存零延迟切换
  • · 评估管线 — 支持 LLM-as-a-Judge、代码评估、用户反馈收集和自定义评估管道

LangWatch

3.5k · TypeScript
活跃 A

LLM 评估和 AI Agent 测试平台,提供全面的追踪、评估和质量监控能力,帮助团队构建可靠的 AI 应用。

observabilityevaluationllm-testing +2
  • · 端到端 Agent 仿真——对全栈运行真实场景,精准定位 Agent 出错的位置和原因
  • · 统一的评估+可观测性+Prompt 管理闭环——追踪、数据集、评估、优化、重新测试一气呵成
  • · 基于 OpenTelemetry/OTLP 原生架构,框架无关、LLM 提供商无关,无厂商锁定

相关文章