Docling
活跃简介
Docling 是 IBM 开源的文档解析工具,支持 PDF、Word、PPT、HTML 等格式转换为 AI 可用结构化数据,专为 GenAI 和 RAG 管道设计。
核心特性
- 多格式文档解析 — 支持 PDF、DOCX、PPTX、XLSX、HTML、WAV、MP3、邮件、图片、LaTeX 等多种格式
- 高级 PDF 理解 — 支持页面布局分析、阅读顺序识别、表格结构提取、公式识别和图像分类
- DoclingDocument 统一表示 — 提供统一的文档表示格式,支持 Markdown、HTML、WebVTT、DocTags 和无损 JSON 导出
- 本地执行能力 — 支持本地运行,适用于敏感数据和离线环境,无需连接外部服务
- AI 框架集成 — 即插即用集成 LangChain、LlamaIndex、Crew AI 和 Haystack,支持 agentic AI 工作流
- OCR 与 VLM 支持 — 支持扫描 PDF 和图片的 OCR,以及 GraniteDocling 等视觉语言模型
适用场景
💡 将 PDF 学术论文转换为结构化 Markdown,直接导入 RAG 知识库进行问答
💡 批量处理企业合同文档,提取表格、条款等关键信息并结构化存储
💡 为 LLM 管道预处理多格式文档,统一输出为 AI 可用的文本格式
💡 解析专利、学术文章和财务报告等专业文档,提取结构化数据
💡 在离线环境中处理敏感文档,确保数据不离开本地基础设施
优势与不足
✅ 优势
- • 活跃维护,近期持续更新
- • 社区热度高(64.9k stars)
- • 开源许可证友好(MIT)
- • 项目有一定历史沉淀(已维护 2 年)
分类
快速开始
pip install docling
from docling.document_converter import DocumentConverter
# 转换本地文件或 URL
source = "https://arxiv.org/pdf/2408.09869"
converter = DocumentConverter()
result = converter.convert(source)
print(result.document.export_to_markdown())
# CLI 使用方式
docling https://arxiv.org/pdf/2206.01062