Docstrange

不活跃
GitHub Python MIT

简介

通用文档格式转换工具,支持从 PDF、图片、Word、PPT 等提取数据并转换为 Markdown、JSON、CSV 等多种格式。

核心特性

  • 多格式转换——将 PDF、DOCX、PPTX、XLSX、图片和 URL 转换为 Markdown、JSON、CSV 和 HTML
  • 7B 参数模型——升级的核心模型,显著提高准确性和对复杂文档的理解能力
  • 高级 OCR 管道——从扫描文档、手机照片和收据中高精度提取文本
  • 结构化提取——提取特定字段或按自定义 JSON 模式输出
  • 云端和本地模式——免费云 API 每月处理 10,000 个文档,或 100% 私有本地 GPU 处理
  • 内置 Web UI——本地拖放界面,支持离线文档转换

适用场景

💡 RAG 管道准备——将文档转换为 LLM 优化的 Markdown 用于检索增强生成
💡 发票和收据处理——从扫描文档中提取发票号码、总金额等关键数据
💡 文档数字化——将历史纸质文档和照片转换为可搜索的结构化格式
💡 合规敏感环境——运行 100% 本地处理,将文档数据保留在本地

快速开始

pip install docstrange → from docstrange import DocumentExtractor → extractor = DocumentExtractor() → result = extractor.extract('document.pdf') → result.extract_markdown() 或 result.extract_data()

相关项目