PageIndex

活跃
GitHub Python MIT

简介

开源向量无关的推理型 RAG 系统,绕过 chunking 与向量检索,用 LLM 在层级树索引上做上下文感知检索。

核心特性

  • 向量无关检索 — 无需向量数据库或 chunking,通过文档结构与 LLM 推理完成检索
  • 层级树索引 — 自动从长文档生成 TOC 树状结构,模拟人类专家导航
  • 推理驱动 — 每个检索结果都可追溯到具体页码和章节
  • 上下文感知 — 检索依赖完整对话上下文,可动态加入新信息
  • 树搜索算法 — LLM 在索引树上进行多步推理找到相关段落
  • 高精度 — 在 FinanceBench 上达到 98.7% 准确率,远超向量检索

适用场景

💡 在长篇财务报告、监管文件和学术教材上做高精度问答
💡 构建可解释的 RAG 系统,每个检索结果都能追溯到原始页码
💡 替换传统向量检索以避免相似而非相关的误召回
💡 集成到企业知识库,处理需要多步推理的专业文档
💡 为 LLM 提供 Agentic 工具调用以完成文档分析任务

优势与不足

优势

  • 活跃维护,近期持续更新
  • 社区热度高(35.2k stars)
  • 开源许可证友好(MIT)
  • Issue 响应及时,积压少

快速开始

git clone https://github.com/VectifyAI/PageIndex.git
cd PageIndex
pip install -r requirements.txt
export OPENAI_API_KEY=sk-...
python examples/agentic_vectorless_rag_demo.py

相关项目

KAG

9.0k · Python
不活跃 B

KAG 是基于 OpenSPG 引擎和 LLM 的逻辑形式引导推理与检索框架,用于构建专业领域知识库的逻辑推理和事实问答解决方案,有效克服传统 RAG 向量相似度计算模型的不足。

knowledge-graphragreasoning +2
  • · 知识与文本双向索引:知识图谱节点与原文分块互相索引,保留完整上下文信息
  • · 逻辑形式引导的混合推理:将自然语言问题转化为形式化逻辑推理,支持精确匹配、文本检索、数值计算与语义推理
  • · Schema 约束的知识构建:兼容自由信息抽取与领域专家知识的结构化表示

FlagEmbedding

12.1k · Python
活跃 A

智源研究院开源的 BGE 系列嵌入模型与检索工具,提供业界领先的中英文文本嵌入与重排序模型,广泛应用于 RAG 系统和 AI Agent 检索链路。

embeddingsbgeretrieval +3
  • · 业界领先的多语言嵌入模型 BGE-M3,支持 100+ 语言的稠密、词法和多向量检索
  • · BGE-VL 多模态嵌入模型,支持文本到图像、图像到文本及跨模态视觉搜索
  • · 轻量级重排序器,支持 token 压缩和分层轻量化操作,高效节省资源

LightRAG

38.9k · Python
活跃 A+

LightRAG 是一个简洁高效的 RAG 框架,使用图结构增强检索效果,发表于 EMNLP 2025。

raggraphretrieval +2
  • · 图结构增强检索 — 使用知识图谱实体和关系进行双层检索(local/global),比传统向量检索更精准
  • · 四种文本分块策略 — 支持 Fixed、Recursive、Vector、Paragraph 分块,适应不同文档类型
  • · 多后端存储支持 — 兼容 Neo4j、PostgreSQL、MongoDB、OpenSearch、JSON KV Store 等多种存储方案

RAG Techniques

29.1k · Jupyter Notebook
活跃 A+

NirDiamant 的 RAG_Techniques 仓库系统收录并演示了当下主流的检索增强生成(RAG)进阶技术与工程实践。

ragretrievaltechniques +2
  • · 系统化分类 — 把 RAG 技术按简单 / 高级 / 模块化等维度组织,便于按需学习
  • · 可运行 Notebook — 每个技术都附 Jupyter Notebook 与最小可运行代码
  • · 评测与对比 — 同时提供检索质量、答案质量的评测脚本与可视化