Ragas

不活跃
GitHub Python Apache-2.0

简介

Ragas 是一个用于评估 RAG(检索增强生成)系统的框架。提供多种评估指标,包括忠实度、答案相关性、上下文精确度等,帮助开发者优化 RAG 应用性能。

核心特性

  • 基于 LLM 和传统方法的客观评估指标,精准衡量 LLM 应用质量
  • 自动生成覆盖多种场景的测试数据集,专为 RAG 系统设计
  • 无缝集成 LangChain、主流可观测性工具及热门 LLM 框架
  • 基于生产数据的反馈循环,持续优化 LLM 应用性能
  • 预置快速启动模板,支持 RAG 评估、Agent 评估和 LLM 基准测试
  • DiscreteMetric 支持自定义维度评估,提供细粒度评分与推理

适用场景

💡 使用忠实度、相关性和上下文精确度指标评估 RAG 管道质量
💡 对比不同 LLM 提示词和配置,找到最优方案
💡 生成合成测试数据集,对检索和生成组件进行压力测试
💡 为生产环境中的 LLM 应用构建 CI/CD 评估门禁

优势与不足

优势

  • 社区热度高(15.3k stars)
  • 开源许可证友好(Apache-2.0)
  • 项目有一定历史沉淀(已维护 3 年)

快速开始

pip install ragas && ragas quickstart rag_eval -o ./my-project

相关项目

TruLens

3.5k · Python
活跃 A

TruLens 是一个用于评估和跟踪 LLM 应用的开源工具。提供针对 RAG 应用的专门评估功能,包括上下文相关性、接地性和答案相关性等评估维度。

llmevaluationobservability +1
  • · 基于 OpenTelemetry 的追踪,结构化 OTEL Span
  • · 7 个智能体评估器:一致性、效率、计划遵循、质量、工具选择、工具调用、工具质量
  • · 批量和内联评估,可配置 worker 数

DeepEval

17.6k · Python
活跃 A

DeepEval 是一个用于 LLM 应用的开源评估框架。提供丰富的评估指标和工具,支持单元测试、集成测试,帮助开发者构建可靠的 LLM 应用。

llmevaluationtesting +1
  • · 兼容 Pytest 的 LLM 评估框架,提供开箱即用的智能体、RAG 和聊天机器人评估指标
  • · 智能体指标包括任务完成度、工具正确性、步骤效率和计划遵循度
  • · RAG 指标涵盖答案相关性、忠实度、上下文召回/精确度/相关性和 RAGAS

PromptTools

3.0k · Python
不活跃 B

PromptTools 是开源的提示词测试与实验工具集,支持多种 LLM(OpenAI、LLaMA)和向量数据库(Chroma、Weaviate、LanceDB),帮助开发者系统化评估和优化 RAG 系统。

prompt-testingragevaluation +3
  • · 开源的提示词测试与实验工具,支持多种 LLM 提供商
  • · 支持 OpenAI、Anthropic、LLaMA、Mistral、Gemini、HuggingFace 等
  • · 向量数据库评估:Chroma、Weaviate、Qdrant、LanceDB、Pinecone

Production Agentic RAG Course

8.3k · Python
正常 A

Production Agentic RAG Course 是一个面向生产环境的 Agentic RAG 课程项目,教授如何构建可扩展、可靠的 RAG Agent 系统。涵盖索引策略、检索优化、Agent 路由和监控等生产级实践。

ragproductioncourse +2
  • · 7 周渐进式课程,从基础设施到 Agentic RAG 完整覆盖
  • · 生产级 RAG 系统:BM25 关键词搜索 + 向量语义检索的混合搜索
  • · 集成 LangGraph 实现智能决策、文档评分和查询重写

相关文章