Docling

活跃
GitHub Python MIT

简介

Docling 是 IBM 开源的文档解析工具,支持 PDF、Word、PPT、HTML 等格式转换为 AI 可用结构化数据,专为 GenAI 和 RAG 管道设计。

核心特性

  • 多格式文档解析 — 支持 PDF、DOCX、PPTX、XLSX、HTML、WAV、MP3、邮件、图片、LaTeX 等多种格式
  • 高级 PDF 理解 — 支持页面布局分析、阅读顺序识别、表格结构提取、公式识别和图像分类
  • DoclingDocument 统一表示 — 提供统一的文档表示格式,支持 Markdown、HTML、WebVTT、DocTags 和无损 JSON 导出
  • 本地执行能力 — 支持本地运行,适用于敏感数据和离线环境,无需连接外部服务
  • AI 框架集成 — 即插即用集成 LangChain、LlamaIndex、Crew AI 和 Haystack,支持 agentic AI 工作流
  • OCR 与 VLM 支持 — 支持扫描 PDF 和图片的 OCR,以及 GraniteDocling 等视觉语言模型

适用场景

💡 将 PDF 学术论文转换为结构化 Markdown,直接导入 RAG 知识库进行问答
💡 批量处理企业合同文档,提取表格、条款等关键信息并结构化存储
💡 为 LLM 管道预处理多格式文档,统一输出为 AI 可用的文本格式
💡 解析专利、学术文章和财务报告等专业文档,提取结构化数据
💡 在离线环境中处理敏感文档,确保数据不离开本地基础设施

优势与不足

优势

  • 活跃维护,近期持续更新
  • 社区热度高(64.9k stars)
  • 开源许可证友好(MIT)
  • 项目有一定历史沉淀(已维护 2 年)

快速开始

pip install docling

from docling.document_converter import DocumentConverter

# 转换本地文件或 URL
source = "https://arxiv.org/pdf/2408.09869"
converter = DocumentConverter()
result = converter.convert(source)
print(result.document.export_to_markdown())

# CLI 使用方式
docling https://arxiv.org/pdf/2206.01062

相关项目

RAGatouille

4.0k · Python
不活跃 C

轻松使用和训练最先进的后期交互检索方法(ColBERT),模块化设计,可将 ColBERT 模型集成到任何 RAG 管道中,显著提升检索精度。

ragpythonembedding +1
  • · ColBERT 后期交互检索:将先进的 ColBERT 模型封装为简单 API,无需深入了解检索论文即可在 RAG 管道中使用后期交互检索方法
  • · 端到端训练与微调:内置 RAGTrainer 和 TrainingDataProcessor,自动处理数据去重、正负样本配对和硬负例挖掘,支持从零训练或微调预训练模型
  • · 模块化可组合架构:DataProcessor、NegativeMiner 等组件可独立使用,也支持自定义 NegativeMiner 接入训练管道

MemAgent

1.1k · Python
不活跃 B

可扩展至 350 万上下文 token 的记忆智能体框架,附带用于任意智能体工作流 RL 训练的训练框架,解决长上下文记忆难题。

memoryagentrag +2
  • · 超长上下文处理:从 8K 训练上下文外推至 350 万 token,性能损失低于 5%
  • · 强化学习驱动:采用 RLVR(可验证奖励强化学习)训练,扩展 DAPO 算法支持多轮对话端到端优化
  • · 线性时间复杂度:突破长文本处理的计算瓶颈,资源随文本长度线性扩展