RAG-Anything

活跃
GitHub Python MIT

简介

全模态 RAG 框架,支持文本、图像、表格、公式等多种文档格式的检索增强生成,实现统一的知识问答能力。

核心特性

  • 全模态端到端流水线 — 从文档摄取、解析到多模态查询应答的完整工作流
  • 通用文档支持 — 无缝处理 PDF、Office 文档、图片等多种文件格式
  • 专用内容分析 — 图像、表格、数学公式、异构内容的专用处理器
  • 多模态知识图谱 — 自动实体提取和跨模态关系发现
  • 自适应处理模式 — 灵活的 MinerU 解析或直接多模态内容注入
  • 混合智能检索 — 跨文本和多模态内容的高级搜索,含上下文理解

适用场景

💡 学术论文问答,同时理解文字、图表和公式
💡 技术文档检索,处理含表格和图片的混合格式文档
💡 财务报告分析,提取表格数据并结合文字说明
💡 企业知识管理,统一检索多格式内部文档
💡 多模态研究资料分析,跨文档关联图像和文字信息

优势与不足

优势

  • 活跃维护,近期持续更新
  • 社区热度高(22.9k stars)
  • 开源许可证友好(MIT)
  • Issue 响应及时,积压少

快速开始

```bash
# 安装
pip install raganything

# 使用 uv(推荐)
uv pip install raganything

# 基础用法
from raganything import RAGAnything
rag = RAGAnything()
rag.ingest_document("your_document.pdf")
result = rag.query("文档中提到了哪些实验结果?")
```

相关项目

DocsGPT

18.2k · Python
活跃 A+

面向文档的 AI 助手平台,支持私有化部署,内置 Agent 构建器、深度研究、文档分析和多模型支持,适用于企业知识检索和智能问答场景。

document-qaragknowledge-base +2
  • · 广泛格式支持:PDF、DOCX、CSV、XLSX、音频等多种文档格式
  • · 语音工作流:录音转文字,支持会议录音和语音笔记搜索
  • · Agent 构建器:可视化构建条件节点的 AI 工作流

RAGFlow

88.6k · Go
活跃 A+

领先的开源 RAG 引擎,融合前沿 RAG 技术与 Agent 能力,为 LLM 提供高质量的上下文层,支持深度文档理解、知识库管理和智能检索。

ragdocument-understandingknowledge-base +3
  • · 深度文档理解 — 基于 deepdoc 技术从复杂格式非结构化数据中提取知识,支持 PDF、Word、PPT、Excel、图片等
  • · 模板化分块 — 提供多种智能分块模板选项,实现可解释的文档切分与知识组织
  • · 可追溯引用与减少幻觉 — 可视化文本分块结果,支持人工干预,答案附带关键参考来源

Jina AI Serve

21.9k · Python
不活跃 B

Jina AI Serve 是一个云原生多模态 AI 应用构建框架,支持构建 RAG 管道、Agent 系统和多模态搜索应用。

multimodalragcloud-native +2
  • · 多协议支持 — 通过 gRPC、HTTP 和 WebSocket 通信,灵活构建 AI 服务
  • · LLM 流式输出 — 支持 token-by-token 流式响应,适合实时交互场景
  • · 内置容器化 — 原生 Docker 集成和 Executor Hub,一键推送和部署

QAnything

14.1k · Python
不活跃 C

QAnything 是网易有道开源的本地知识库问答系统,支持任意格式文件,提供离线 RAG 能力,可快速搭建私有知识问答。

ragqaknowledge-base +1
  • · 本地知识库问答,支持 PDF、Word、PPT、XLS、Markdown、图片、CSV 等多种格式
  • · 两阶段向量检索:嵌入 + 重排序,大规模数据下精度稳定提升
  • · 完全离线运行,支持断网环境安装部署