OpenDataLoader PDF

活跃
GitHub Java Apache-2.0

简介

opendataloader-pdf 是开源 PDF 解析与抽取工具,支持版面分析、表格抽取、OCR 与结构化输出,可作为 RAG 与文档 Agent 的解析层。

核心特性

  • PDF 解析 — 文本、图像、表格、表单字段全维度抽取
  • 版面分析 — 自动识别页眉、段落、图、表格、列表
  • 表格抽取 — 表格还原成可复用的结构化数据
  • OCR 集成 — 对扫描件自动调用 OCR
  • 多格式输出 — JSON、Markdown、HTML、JSONL
  • RAG 友好 — 输出 chunk 维度,直接对接向量库

适用场景

💡 为 RAG 应用批量解析合同、报告、论文 PDF
💡 把扫描件 PDF 转成可检索的文档
💡 作为文档 Agent 的统一解析层
💡 对 PDF 进行结构化数据分析(财报、发票、研究报告)

优势与不足

优势

  • 活跃维护,近期持续更新
  • 社区热度高(28.5k stars)
  • 开源许可证友好(Apache-2.0)
  • Issue 响应及时,积压少

快速开始

pip install opendataloader-pdf

opendataloader-pdf extract ./contract.pdf --format markdown

相关项目

Crawl4AI

23.0k · Python
不活跃 B

Crawl4AI 是面向 LLM 与 Agent 的网页抓取工具,提供结构化提取、站点遍历、内容清洗与爬取控制能力,适合作为 Agent 获取外部网页知识的入口层。

crawlingwebextraction +1
  • · LLM 友好内容提取 — 将网页 HTML 清洗为适合大模型消费的 Markdown 或结构化数据
  • · 批量异步爬取 — 支持并发抓取多个 URL,自动处理速率限制和反爬机制
  • · 深度站点遍历 — 递归发现和抓取网站子页面,自动构建站点地图

PageIndex

35.2k · Python
活跃 A+

开源向量无关的推理型 RAG 系统,绕过 chunking 与向量检索,用 LLM 在层级树索引上做上下文感知检索。

ragreasoningretrieval +3
  • · 向量无关检索 — 无需向量数据库或 chunking,通过文档结构与 LLM 推理完成检索
  • · 层级树索引 — 自动从长文档生成 TOC 树状结构,模拟人类专家导航
  • · 推理驱动 — 每个检索结果都可追溯到具体页码和章节

PaddleOCR

87.7k · Python
活跃 A+

PaddleOCR 是百度开源的多语言 OCR 与文档智能工具箱,支持 80+ 语言与 PP-Structure 版面分析。

ocrpaddlepaddledocument-ai +2
  • · 多语言识别 — 内置 80+ 主流语言模型,简体中文、繁体、英文、阿拉伯文等
  • · PP-Structure 版面分析 — 文本块、表格、图、公式自动分类与定位
  • · PP-OCRv4 高精度 — 业界领先的检测 + 识别端到端精度