LangWatch

活跃
GitHub TypeScript Apache-2.0

简介

LLM 评估和 AI Agent 测试平台,提供全面的追踪、评估和质量监控能力,帮助团队构建可靠的 AI 应用。

核心特性

  • 端到端 Agent 仿真——对全栈运行真实场景,精准定位 Agent 出错的位置和原因
  • 统一的评估+可观测性+Prompt 管理闭环——追踪、数据集、评估、优化、重新测试一气呵成
  • 基于 OpenTelemetry/OTLP 原生架构,框架无关、LLM 提供商无关,无厂商锁定
  • AI 网关支持虚拟密钥、分层预算、内联护栏和自动提供商故障转移
  • 协作工具支持标注、队列和 GitHub 集成的 Prompt 版本管理,并与追踪链路关联
  • 多框架集成,支持 LangChain、LangGraph、Vercel AI SDK、CrewAI 等

适用场景

💡 在类生产场景中对 LLM 驱动的 Agent 进行发布前回归测试
💡 对 LLM 调用、成本和质量进行实时生产可观测性和监控
💡 通过版本控制和 A/B 测试进行 Prompt 工程优化
💡 多提供商 LLM 成本治理和自动故障转移
💡 通过标注工作流和共享评估数据集实现团队 AI 质量协作

快速开始

1. 在 app.langwatch.ai 创建免费账户,或本地运行 `npx @langwatch/server`
2. 创建项目并获取 API 密钥
3. 安装 SDK:`pip install langwatch`(Python)或 `npm install langwatch`(TypeScript)
4. 使用 `@langwatch.trace()` 装饰器为 LLM 调用添加追踪
5. 通过仪表板的 Scenario 功能运行你的第一次 Agent 仿真

相关项目