LightRAG

活跃
GitHub Python MIT

简介

LightRAG 是一个简洁高效的 RAG 框架,使用图结构增强检索效果,发表于 EMNLP 2025。

核心特性

  • 图结构增强检索 — 使用知识图谱实体和关系进行双层检索(local/global),比传统向量检索更精准
  • 四种文本分块策略 — 支持 Fixed、Recursive、Vector、Paragraph 分块,适应不同文档类型
  • 多后端存储支持 — 兼容 Neo4j、PostgreSQL、MongoDB、OpenSearch、JSON KV Store 等多种存储方案
  • 多模态文档处理 — 通过 RAG-Anything 集成,支持 PDF、图片、Office 文档、表格、公式的解析和提取
  • 角色化 LLM 配置 — 四种独立角色(EXTRACT、QUERY、KEYWORDS、VLM)可分别配置不同的 LLM
  • WebUI 可视化管理 — 提供 Web 界面进行知识插入、查询和知识图谱可视化浏览

适用场景

💡 大规模文档知识库 — 构建包含数万文档的知识图谱,通过双层检索快速定位相关实体和关系
💡 学术论文分析 — 提取论文中的方法、实验和结论,构建领域知识图谱辅助文献综述
💡 企业知识管理 — 整合内部文档、邮件和报告,通过图检索实现跨文档关联查询
💡 多模态 RAG 系统 — 处理包含图片、表格和公式的 PDF 文档,实现全模态检索增强生成
💡 智能问答系统 — 结合图检索和向量检索,构建能够回答复杂关联问题的 QA 系统

优势与不足

优势

  • 活跃维护,近期持续更新
  • 社区热度高(39.5k stars)
  • 开源许可证友好(MIT)
  • Issue 响应及时,积压少

快速开始

```bash
pip install lightrag-hku

python -c "
import lightrag
from lightrag import LightRAG

rag = LightRAG(work_dir='./lightrag_work')
with open('input.txt', 'r') as f:
    text = f.read()
rag.ainsert(text)
result = rag.aquery('What is the main topic?')
print(result)
"
```

相关项目

Haystack

26.4k · Python
活跃 A+

Haystack 是企业级 RAG 与搜索应用框架,支持文档处理、检索、生成与评估全链路。

ragretrievalllm +1
  • · 模块化管道架构 — 通过有向无环图组合检索、路由、记忆和生成组件,支持条件分支与循环
  • · 模型与供应商无关 — 无缝切换 OpenAI、Anthropic、Cohere、Hugging Face、AWS Bedrock 等,无需重写系统
  • · 上下文工程控制 — 显式控制信息检索、排序、过滤、组合和路由,确保上下文质量和可追溯性

MemAgent

1.1k · Python
不活跃 B

可扩展至 350 万上下文 token 的记忆智能体框架,附带用于任意智能体工作流 RL 训练的训练框架,解决长上下文记忆难题。

memoryagentrag +2
  • · 超长上下文处理:从 8K 训练上下文外推至 350 万 token,性能损失低于 5%
  • · 强化学习驱动:采用 RLVR(可验证奖励强化学习)训练,扩展 DAPO 算法支持多轮对话端到端优化
  • · 线性时间复杂度:突破长文本处理的计算瓶颈,资源随文本长度线性扩展

RAG Techniques

29.4k · Jupyter Notebook
活跃 A+

NirDiamant 的 RAG_Techniques 仓库系统收录并演示了当下主流的检索增强生成(RAG)进阶技术与工程实践。

ragretrievaltechniques +2
  • · 系统化分类 — 把 RAG 技术按简单 / 高级 / 模块化等维度组织,便于按需学习
  • · 可运行 Notebook — 每个技术都附 Jupyter Notebook 与最小可运行代码
  • · 评测与对比 — 同时提供检索质量、答案质量的评测脚本与可视化

KAG

9.0k · Python
不活跃 B

KAG 是基于 OpenSPG 引擎和 LLM 的逻辑形式引导推理与检索框架,用于构建专业领域知识库的逻辑推理和事实问答解决方案,有效克服传统 RAG 向量相似度计算模型的不足。

knowledge-graphragreasoning +2
  • · 知识与文本双向索引:知识图谱节点与原文分块互相索引,保留完整上下文信息
  • · 逻辑形式引导的混合推理:将自然语言问题转化为形式化逻辑推理,支持精确匹配、文本检索、数值计算与语义推理
  • · Schema 约束的知识构建:兼容自由信息抽取与领域专家知识的结构化表示

相关文章