Unstructured

活跃
GitHub HTML Apache-2.0

简介

Unstructured 提供文档解析与清洗能力,是 RAG 数据摄取和预处理环节常用的开源组件。

核心特性

  • 开源文档解析,支持 PDF、HTML、Word 等格式
  • 模块化分区函数,用于文本提取和结构检测
  • Docker 支持,多平台镜像兼容 x86_64 和 Apple Silicon
  • 可直接集成到 RAG 摄取和预处理管道中
  • 支持图像、表格和复杂文档布局
  • 可通过 PyPI 安装,支持本地开发环境搭建

适用场景

💡 为 LLM 摄取预处理非结构化文档
💡 构建需要可靠文档解析的 RAG 管道
💡 从 PDF 中提取文本和表格用于下游分析
💡 自动化 AI/ML 工作流中的数据预处理
💡 将混合文档格式转换为结构化输出

优势与不足

优势

  • 活跃维护,近期持续更新
  • 社区热度高(15.3k stars)
  • 开源许可证友好(Apache-2.0)
  • 项目有一定历史沉淀(已维护 3 年)

快速开始

1. 拉取 Docker 镜像:`docker pull downloads.unstructured.io/unstructured-io/unstructured:latest`。
2. 或从 PyPI 安装:`pip install unstructured`。
3. 使用 `partition` 函数对文档进行分区处理。
4. 将结构化输出用于 RAG 或 LLM 管道。

相关项目

Sparrow

5.2k · Python
活跃 A

Sparrow 是一个结构化数据提取工具,支持通过机器学习、LLM 和视觉语言模型从文档中提取结构化数据并进行指令调用,适用于 RAG 管道中的文档解析环节。

data-extractiondocument-processingllm +3
  • · 支持从发票、收据、报表和表格等多种文档中提取结构化数据
  • · 可插拔架构,混合使用 Vision LLM、Text LLM 和 Agent 管道
  • · 多后端支持:MLX(Apple Silicon)、vLLM(NVIDIA)、Ollama、Hugging Face

RAGatouille

4.0k · Python
不活跃 C

轻松使用和训练最先进的后期交互检索方法(ColBERT),模块化设计,可将 ColBERT 模型集成到任何 RAG 管道中,显著提升检索精度。

ragpythonembedding +1
  • · ColBERT 后期交互检索:将先进的 ColBERT 模型封装为简单 API,无需深入了解检索论文即可在 RAG 管道中使用后期交互检索方法
  • · 端到端训练与微调:内置 RAGTrainer 和 TrainingDataProcessor,自动处理数据去重、正负样本配对和硬负例挖掘,支持从零训练或微调预训练模型
  • · 模块化可组合架构:DataProcessor、NegativeMiner 等组件可独立使用,也支持自定义 NegativeMiner 接入训练管道

MemAgent

1.1k · Python
不活跃 B

可扩展至 350 万上下文 token 的记忆智能体框架,附带用于任意智能体工作流 RL 训练的训练框架,解决长上下文记忆难题。

memoryagentrag +2
  • · 超长上下文处理:从 8K 训练上下文外推至 350 万 token,性能损失低于 5%
  • · 强化学习驱动:采用 RLVR(可验证奖励强化学习)训练,扩展 DAPO 算法支持多轮对话端到端优化
  • · 线性时间复杂度:突破长文本处理的计算瓶颈,资源随文本长度线性扩展

相关文章