RAGFlow

活跃
GitHub Go Apache-2.0

简介

领先的开源 RAG 引擎,融合前沿 RAG 技术与 Agent 能力,为 LLM 提供高质量的上下文层,支持深度文档理解、知识库管理和智能检索。

核心特性

  • 深度文档理解 — 基于 deepdoc 技术从复杂格式非结构化数据中提取知识,支持 PDF、Word、PPT、Excel、图片等
  • 模板化分块 — 提供多种智能分块模板选项,实现可解释的文档切分与知识组织
  • 可追溯引用与减少幻觉 — 可视化文本分块结果,支持人工干预,答案附带关键参考来源
  • Agent 工作流与 MCP — 支持可编排的 Agent 工作流和 MCP 协议,内置代码执行器组件
  • 异构数据源兼容 — 支持 Word、PPT、Excel、图片、扫描件、结构化数据、网页等多种数据格式
  • 跨语言查询与数据同步 — 支持跨语言检索,可从 Confluence、S3、Notion、Discord、Google Drive 同步数据

适用场景

💡 企业知识库构建,将内部文档、合同、报告等非结构化数据转化为可检索的知识库
💡 智能客服系统,基于企业文档为 LLM 提供精准上下文,减少回答幻觉
💡 法律与合规文档分析,从大量法律文件中快速检索和引用关键条款
💡 多模态文档问答,解析含图片的 PDF/DOCX 文件并进行跨语言智能问答
💡 研发知识管理,同步技术文档和代码库,为开发团队提供统一的知识检索入口

优势与不足

优势

  • 活跃维护,近期持续更新
  • 社区热度高(88.6k stars)
  • 开源许可证友好(Apache-2.0)
  • 项目有一定历史沉淀(已维护 2 年)

快速开始

# 确保 Docker >= 24.0.0 和 Docker Compose >= v2.26.1
# 设置系统参数
sysctl -w vm.max_map_count=262144

# 克隆仓库并启动
git clone https://github.com/infiniflow/ragflow.git
cd ragflow
docker compose up -d

# 访问 Web 界面
# 浏览器打开 http://localhost:80
# 在 UI 中配置 LLM 和 Embedding 模型,上传文档即可开始 RAG 问答

相关项目

LightRAG

38.9k · Python
活跃 A+

LightRAG 是一个简洁高效的 RAG 框架,使用图结构增强检索效果,发表于 EMNLP 2025。

raggraphretrieval +2
  • · 图结构增强检索 — 使用知识图谱实体和关系进行双层检索(local/global),比传统向量检索更精准
  • · 四种文本分块策略 — 支持 Fixed、Recursive、Vector、Paragraph 分块,适应不同文档类型
  • · 多后端存储支持 — 兼容 Neo4j、PostgreSQL、MongoDB、OpenSearch、JSON KV Store 等多种存储方案

RAG-Anything

22.9k · Python
活跃 A+

全模态 RAG 框架,支持文本、图像、表格、公式等多种文档格式的检索增强生成,实现统一的知识问答能力。

ragmultimodalknowledge-base +2
  • · 全模态端到端流水线 — 从文档摄取、解析到多模态查询应答的完整工作流
  • · 通用文档支持 — 无缝处理 PDF、Office 文档、图片等多种文件格式
  • · 专用内容分析 — 图像、表格、数学公式、异构内容的专用处理器

DocsGPT

18.2k · Python
活跃 A+

面向文档的 AI 助手平台,支持私有化部署,内置 Agent 构建器、深度研究、文档分析和多模型支持,适用于企业知识检索和智能问答场景。

document-qaragknowledge-base +2
  • · 广泛格式支持:PDF、DOCX、CSV、XLSX、音频等多种文档格式
  • · 语音工作流:录音转文字,支持会议录音和语音笔记搜索
  • · Agent 构建器:可视化构建条件节点的 AI 工作流

Haystack

26.2k · Python
活跃 A+

Haystack 是企业级 RAG 与搜索应用框架,支持文档处理、检索、生成与评估全链路。

ragretrievalllm +1
  • · 模块化管道架构 — 通过有向无环图组合检索、路由、记忆和生成组件,支持条件分支与循环
  • · 模型与供应商无关 — 无缝切换 OpenAI、Anthropic、Cohere、Hugging Face、AWS Bedrock 等,无需重写系统
  • · 上下文工程控制 — 显式控制信息检索、排序、过滤、组合和路由,确保上下文质量和可追溯性