Parsr

不活跃
GitHub JavaScript Apache-2.0

简介

将 PDF、文档和图片转换为结构化数据的文档处理管道,支持表格识别、阅读顺序还原和 Markdown 输出。

核心特性

  • 多格式文档解析:支持 PDF、DOCX、图片和 EML 文件,轻量级部署
  • 结构化输出:支持 JSON、Markdown、CSV/Pandas DataFrame 和 TXT 格式
  • 文档结构检测:标题、表格、列表、目录、页码、页眉/页脚和链接
  • 表格识别与提取,还原阅读顺序,准确保留内容
  • 基于 Docker 的部署,提供 GUI 用于文档提交和结果可视化
  • Python 客户端和 Jupyter Notebook 集成,支持编程式文档处理

适用场景

💡 保险和金融文档的自动数据录入和文档分析自动化
💡 将扫描的 PDF 和图像转换为结构化的机器可读数据,供下游处理
💡 遗留文档的归档和数字化,保持正确的阅读顺序和结构
💡 RAG 流水线预处理:从文档中提取干净的文本和结构化数据供 AI 摄入

优势与不足

优势

  • 社区热度高(6.2k stars)
  • 开源许可证友好(Apache-2.0)

快速开始

docker pull axarev/parsr
docker run -p 3001:3001 axarev/parsr

# API 运行在 http://localhost:3001
# 安装 Python 客户端:
pip install parsr-client

# 或使用 GUI:
docker run -t -p 8080:80 axarev/parsr-ui-localhost:latest

相关项目

Crawlee

25.7k · TypeScript
活跃 A+

Crawlee 是一个面向 Node.js 的 Web 爬取和浏览器自动化库,支持 Puppeteer、Playwright、Cheerio 等多种引擎,专为构建可靠的爬虫而设计,可提取 HTML、PDF 等数据用于 AI、LLM 和 RAG 应用。

typescriptjavascriptdata-processing +3
  • · 多引擎统一接口 — 同一 API 支持 Puppeteer、Playwright、Cheerio 和原始 HTTP
  • · 反检测伪装 — 默认配置即可模拟人类行为规避主流反爬机制
  • · 代理轮换与会话管理 — 内置代理轮换、指纹生成和会话持久化

Unstract

7.2k · Python
活跃 A+

Unstract 是一个由 LLM 驱动的非结构化数据提取平台,专为 API 部署和 ETL 管道工作流而设计。支持从文档、PDF、图片等非结构化数据源中智能提取结构化信息,构建自动化数据处理管道。

data-processingragpython +3
  • · Prompt Studio 通过自然语言定义文档提取模式
  • · 支持 REST API 部署和 ETL 管道工作流
  • · MCP Server 集成,连接 Claude 等 AI Agent