Airweave

不活跃
GitHub Python MIT

简介

开源的 AI Agent 上下文检索层,支持从多种数据源自动提取、索引和检索结构化上下文信息,帮助 AI Agent 更准确地理解和利用企业知识库。

核心特性

  • 支持 50+ 主流应用、数据库和文档集成
  • 统一的 LLM 友好搜索接口,支持多数据源查询
  • 持续数据同步与自动索引功能
  • 提供 SDK、REST API 和 MCP 支持 Agent 集成
  • 支持云托管和自托管部署方式
  • 内置身份验证和数据摄取管道

适用场景

💡 AI Agent 企业知识库检索
💡 需要多源上下文聚合的 RAG 系统
💡 需要最新产品信息的客服机器人
💡 跨平台数据聚合的研究助手
💡 需要跨 SaaS 应用统一搜索的内部工具

优势与不足

优势

  • 社区热度高(6.6k stars)
  • 开源许可证友好(MIT)

快速开始

克隆仓库并运行 ./start.sh 通过 Docker 本地启动,在 http://localhost:8080 访问界面。也可使用 app.airweave.ai 云版本。通过仪表板连接数据源,使用 SDK 或 API 进行查询。

相关项目

Docstrange

1.5k · Python
不活跃 B

通用文档格式转换工具,支持从 PDF、图片、Word、PPT 等提取数据并转换为 Markdown、JSON、CSV 等多种格式。

pythonragtools +2
  • · 多格式转换——将 PDF、DOCX、PPTX、XLSX、图片和 URL 转换为 Markdown、JSON、CSV 和 HTML
  • · 7B 参数模型——升级的核心模型,显著提高准确性和对复杂文档的理解能力
  • · 高级 OCR 管道——从扫描文档、手机照片和收据中高精度提取文本

PDFMathTranslate

36.8k · Python
活跃 A+

AI 驱动的 PDF 学术论文翻译工具,完整保留原始排版格式,支持 Google/DeepL/Ollama/OpenAI 等多种翻译引擎。

ragpythontools +2
  • · 保留排版格式翻译 — 翻译 PDF 学术论文时完整保留公式、图表、目录和批注的原始排版
  • · 多翻译引擎支持 — 支持 Google Translate、DeepL、Ollama、OpenAI、MiniMax 等多种翻译服务
  • · 多种使用方式 — 提供 CLI 命令行、Gradio GUI 界面、Docker 容器、Zotero 插件等多种接入方式

LangExtract

38.5k · Python
活跃 A+

Google 开源的 Python 库,用于利用 LLM 从非结构化文本中精确提取结构化信息,支持源文本标注和交互式可视化,适用于数据标注和知识抽取场景。

data-processingllmpython +2
  • · 精确源文本锚定 — 每条提取结果映射到原文精确位置,支持视觉高亮追溯验证
  • · 受控结构化输出 — 基于 few-shot 示例强制一致输出 Schema,利用 Gemini 受控生成保证结果鲁棒性
  • · 长文档优化策略 — 通过文本分块、并行处理和多轮扫描克服大文档「大海捞针」问题,提升召回率