LangWatch
活跃简介
LLM 评估和 AI Agent 测试平台,提供全面的追踪、评估和质量监控能力,帮助团队构建可靠的 AI 应用。
核心特性
- 端到端 Agent 仿真——对全栈运行真实场景,精准定位 Agent 出错的位置和原因
- 统一的评估+可观测性+Prompt 管理闭环——追踪、数据集、评估、优化、重新测试一气呵成
- 基于 OpenTelemetry/OTLP 原生架构,框架无关、LLM 提供商无关,无厂商锁定
- AI 网关支持虚拟密钥、分层预算、内联护栏和自动提供商故障转移
- 协作工具支持标注、队列和 GitHub 集成的 Prompt 版本管理,并与追踪链路关联
- 多框架集成,支持 LangChain、LangGraph、Vercel AI SDK、CrewAI 等
适用场景
💡 在类生产场景中对 LLM 驱动的 Agent 进行发布前回归测试
💡 对 LLM 调用、成本和质量进行实时生产可观测性和监控
💡 通过版本控制和 A/B 测试进行 Prompt 工程优化
💡 多提供商 LLM 成本治理和自动故障转移
💡 通过标注工作流和共享评估数据集实现团队 AI 质量协作
分类
快速开始
1. 在 app.langwatch.ai 创建免费账户,或本地运行 `npx @langwatch/server`
2. 创建项目并获取 API 密钥
3. 安装 SDK:`pip install langwatch`(Python)或 `npm install langwatch`(TypeScript)
4. 使用 `@langwatch.trace()` 装饰器为 LLM 调用添加追踪
5. 通过仪表板的 Scenario 功能运行你的第一次 Agent 仿真