Zerox

不活跃
GitHub TypeScript MIT

简介

基于视觉模型的 OCR 与文档提取工具,支持将 PDF、图片等文档高效转换为结构化文本。

核心特性

  • 将 PDF、DOCX、图片等文档转换为图像后调用视觉模型生成 Markdown
  • 支持 OpenAI、Azure OpenAI、AWS Bedrock、Google Gemini、Vertex AI 多家模型供应商
  • 提供 Node.js 和 Python 双语言 SDK,异步 API 与并发处理
  • 内置结构化数据提取功能,支持自定义 Schema 从文档中抽取结构化信息
  • 支持页面方向校正、边缘裁剪、格式保持等文档预处理能力
  • 提供 maintainFormat 选项实现跨页表格等复杂布局的一致性输出

适用场景

💡 RAG 管道中将 PDF 文档转换为可检索的 Markdown 文本
💡 发票、合同等商业文档的结构化信息自动提取
💡 批量处理扫描文件并生成可编辑的文本版本
💡 将图表、表格密集型文档转换为 AI 可理解的格式
💡 为 AI Agent 提供文档理解能力,支持多模态输入

快速开始

1. Node.js 安装:`npm install zerox`
2. 使用示例:
```ts
import { zerox } from 'zerox';
const result = await zerox({
  filePath: 'path/to/document.pdf',
  credentials: { apiKey: process.env.OPENAI_API_KEY },
});
```
3. 或安装 Python 版本:`pip install py-zerox`

相关项目