Parsr
不活跃简介
将 PDF、文档和图片转换为结构化数据的文档处理管道,支持表格识别、阅读顺序还原和 Markdown 输出。
核心特性
- 多格式文档解析:支持 PDF、DOCX、图片和 EML 文件,轻量级部署
- 结构化输出:支持 JSON、Markdown、CSV/Pandas DataFrame 和 TXT 格式
- 文档结构检测:标题、表格、列表、目录、页码、页眉/页脚和链接
- 表格识别与提取,还原阅读顺序,准确保留内容
- 基于 Docker 的部署,提供 GUI 用于文档提交和结果可视化
- Python 客户端和 Jupyter Notebook 集成,支持编程式文档处理
适用场景
💡 保险和金融文档的自动数据录入和文档分析自动化
💡 将扫描的 PDF 和图像转换为结构化的机器可读数据,供下游处理
💡 遗留文档的归档和数字化,保持正确的阅读顺序和结构
💡 RAG 流水线预处理:从文档中提取干净的文本和结构化数据供 AI 摄入
分类
快速开始
docker pull axarev/parsr
docker run -p 3001:3001 axarev/parsr
# API 运行在 http://localhost:3001
# 安装 Python 客户端:
pip install parsr-client
# 或使用 GUI:
docker run -t -p 8080:80 axarev/parsr-ui-localhost:latest