Kreuzberg

活跃
GitHub Rust MIT

简介

多语言文档智能提取框架,基于 Rust 核心引擎支持 PDF、Office、图片等 91+ 格式,提供 MCP 服务器、CLI 和 REST API 接入。

核心特性

  • 多语言文档智能提取:基于 Rust 核心引擎,原生支持 PDF、Office、图片等 91+ 文件格式
  • 代码智能分析:通过 tree-sitter 从 300+ 编程语言中提取函数、类、导入、符号和文档字符串
  • 多语言绑定:支持 Python、TypeScript/Node.js、Ruby、Go、Java、Kotlin、C#、PHP、Swift、Zig 等 15+ 语言
  • LLM 智能提取:集成 VLM OCR(GPT-4o、Claude、Gemini 等)和结构化 JSON 提取,支持 143 家 LLM 提供商
  • 多 OCR 后端:支持 Tesseract、PaddleOCR、EasyOCR 和 VLM OCR,可通过插件扩展
  • 灵活部署方式:可用作库、CLI 工具、REST API 服务器或 MCP 服务器

适用场景

💡 RAG 数据管道:从多种文档格式中提取文本和元数据,为 LLM 检索增强生成提供高质量语料
💡 代码库文档生成:自动从源代码中提取符号和文档字符串生成 API 文档
💡 企业文档数字化:批量处理 PDF、Office 文件并提取结构化内容用于知识管理
💡 AI Agent 工具集成:通过 MCP 服务器为 AI Agent 提供文档读取和理解能力

快速开始

1. 选择语言绑定(如 Python: pip install kreuzberg)
2. 从文件或 URL 提取文本:kreuzberg.extract('file.pdf')
3. 启用 OCR:kreuzberg.extract('image.png', ocr_backend='tesseract')
4. 使用 MCP 服务器模式:kreuzberg serve --mcp
5. 查看完整文档:https://kreuzberg.dev

相关项目