PaddleOCR

活跃
GitHub Python Apache-2.0

简介

PaddleOCR 是百度开源的多语言 OCR 与文档智能工具箱,支持 80+ 语言与 PP-Structure 版面分析。

核心特性

  • 多语言识别 — 内置 80+ 主流语言模型,简体中文、繁体、英文、阿拉伯文等
  • PP-Structure 版面分析 — 文本块、表格、图、公式自动分类与定位
  • PP-OCRv4 高精度 — 业界领先的检测 + 识别端到端精度
  • PP-StructureV2 — 表格识别 (TableMaster)、关键信息抽取 (KIE) 一体化
  • PaddleInference / ONNX 推理 — 同时支持飞桨原生与 ONNX 跨平台部署
  • 丰富预训练库 — 检测、识别、方向分类、版面分析、公式识别一应俱全

适用场景

💡 为 Agent 文档场景提供高精度 OCR 与版面解析能力
💡 构建 RAG 系统的 PDF/图片预处理流水线
💡 在合同、发票、证件等场景进行表格与关键信息抽取
💡 多语言文档数字化与跨语言检索

优势与不足

优势

  • 活跃维护,近期持续更新
  • 社区热度高(87.7k stars)
  • 开源许可证友好(Apache-2.0)
  • Issue 响应及时,积压少

快速开始

pip install paddleocr

paddleocr --image_dir ./doc.jpg --use_angle_cls true --lang ch

相关项目

Kreuzberg

9.1k · Rust
活跃 A+

多语言文档智能提取框架,基于 Rust 核心引擎支持 PDF、Office、图片等 91+ 格式,提供 MCP 服务器、CLI 和 REST API 接入。

document-extractionmcpocr +2
  • · 多语言文档智能提取:基于 Rust 核心引擎,原生支持 PDF、Office、图片等 91+ 文件格式
  • · 代码智能分析:通过 tree-sitter 从 300+ 编程语言中提取函数、类、导入、符号和文档字符串
  • · 多语言绑定:支持 Python、TypeScript/Node.js、Ruby、Go、Java、Kotlin、C#、PHP、Swift、Zig 等 15+ 语言