Sparrow
活跃简介
Sparrow 是一个结构化数据提取工具,支持通过机器学习、LLM 和视觉语言模型从文档中提取结构化数据并进行指令调用,适用于 RAG 管道中的文档解析环节。
核心特性
- 支持从发票、收据、报表和表格等多种文档中提取结构化数据
- 可插拔架构,混合使用 Vision LLM、Text LLM 和 Agent 管道
- 多后端支持:MLX(Apple Silicon)、vLLM(NVIDIA)、Ollama、Hugging Face
- 基于 JSON Schema 的自动验证,确保提取结果符合预期结构
- RESTful API 优先设计,轻松集成到任何后端或数据管道
- 内置多步骤 Agent 工作流编排和可视化监控面板
适用场景
💡 企业发票和财务报表的自动化结构化数据提取
💡 将扫描文档和 PDF 转换为可检索的结构化 JSON 用于 RAG 管道
💡 银行对账单和表格数据的批量处理与验证
💡 通过 Agent 框架编排复杂的多步骤文档处理工作流
优势与不足
✅ 优势
- • 活跃维护,近期持续更新
- • 社区热度高(5.2k stars)
- • 项目有一定历史沉淀(已维护 4 年)
- • Issue 响应及时,积压少
⚠️ 不足
- • 许可证限制较多(GPL-3.0)
分类
快速开始
安装 Python 3.12.10+,克隆仓库后进入 sparrow-ml/llm 目录,安装 requirements_sparrow_parse.txt 依赖。macOS 用户需先运行 brew install poppler。启动 API 服务器后,使用 sparrow.sh 脚本传入 JSON Schema 和文档路径即可提取结构化数据。