Kreuzberg
活跃简介
多语言文档智能提取框架,基于 Rust 核心引擎支持 PDF、Office、图片等 91+ 格式,提供 MCP 服务器、CLI 和 REST API 接入。
核心特性
- 多语言文档智能提取:基于 Rust 核心引擎,原生支持 PDF、Office、图片等 91+ 文件格式
- 代码智能分析:通过 tree-sitter 从 300+ 编程语言中提取函数、类、导入、符号和文档字符串
- 多语言绑定:支持 Python、TypeScript/Node.js、Ruby、Go、Java、Kotlin、C#、PHP、Swift、Zig 等 15+ 语言
- LLM 智能提取:集成 VLM OCR(GPT-4o、Claude、Gemini 等)和结构化 JSON 提取,支持 143 家 LLM 提供商
- 多 OCR 后端:支持 Tesseract、PaddleOCR、EasyOCR 和 VLM OCR,可通过插件扩展
- 灵活部署方式:可用作库、CLI 工具、REST API 服务器或 MCP 服务器
适用场景
💡 RAG 数据管道:从多种文档格式中提取文本和元数据,为 LLM 检索增强生成提供高质量语料
💡 代码库文档生成:自动从源代码中提取符号和文档字符串生成 API 文档
💡 企业文档数字化:批量处理 PDF、Office 文件并提取结构化内容用于知识管理
💡 AI Agent 工具集成:通过 MCP 服务器为 AI Agent 提供文档读取和理解能力
分类
快速开始
1. 选择语言绑定(如 Python: pip install kreuzberg)
2. 从文件或 URL 提取文本:kreuzberg.extract('file.pdf')
3. 启用 OCR:kreuzberg.extract('image.png', ocr_backend='tesseract')
4. 使用 MCP 服务器模式:kreuzberg serve --mcp
5. 查看完整文档:https://kreuzberg.dev