Zerox
不活跃简介
基于视觉模型的 OCR 与文档提取工具,支持将 PDF、图片等文档高效转换为结构化文本。
核心特性
- 将 PDF、DOCX、图片等文档转换为图像后调用视觉模型生成 Markdown
- 支持 OpenAI、Azure OpenAI、AWS Bedrock、Google Gemini、Vertex AI 多家模型供应商
- 提供 Node.js 和 Python 双语言 SDK,异步 API 与并发处理
- 内置结构化数据提取功能,支持自定义 Schema 从文档中抽取结构化信息
- 支持页面方向校正、边缘裁剪、格式保持等文档预处理能力
- 提供 maintainFormat 选项实现跨页表格等复杂布局的一致性输出
适用场景
💡 RAG 管道中将 PDF 文档转换为可检索的 Markdown 文本
💡 发票、合同等商业文档的结构化信息自动提取
💡 批量处理扫描文件并生成可编辑的文本版本
💡 将图表、表格密集型文档转换为 AI 可理解的格式
💡 为 AI Agent 提供文档理解能力,支持多模态输入
分类
快速开始
1. Node.js 安装:`npm install zerox`
2. 使用示例:
```ts
import { zerox } from 'zerox';
const result = await zerox({
filePath: 'path/to/document.pdf',
credentials: { apiKey: process.env.OPENAI_API_KEY },
});
```
3. 或安装 Python 版本:`pip install py-zerox`