Crawlee

活跃
GitHub TypeScript Apache-2.0

简介

Crawlee 是一个面向 Node.js 的 Web 爬取和浏览器自动化库,支持 Puppeteer、Playwright、Cheerio 等多种引擎,专为构建可靠的爬虫而设计,可提取 HTML、PDF 等数据用于 AI、LLM 和 RAG 应用。

核心特性

  • 多引擎统一接口 — 同一 API 支持 Puppeteer、Playwright、Cheerio 和原始 HTTP
  • 反检测伪装 — 默认配置即可模拟人类行为规避主流反爬机制
  • 代理轮换与会话管理 — 内置代理轮换、指纹生成和会话持久化
  • 持久化队列 — 支持广度优先和深度优先的 URL 爬取队列
  • 自动扩展 — 根据系统资源自动调整并发爬取规模
  • 结构化数据存储 — 内置 Dataset 和 KeyValueStore 支持表格和文件存储

适用场景

💡 为 AI/RAG 应用批量抓取网页内容构建知识库数据源
💡 抓取电商平台商品信息用于价格监控和竞品分析
💡 自动化采集新闻网站和社交媒体内容用于舆情分析
💡 从需要 JavaScript 渲染的 SPA 网站提取结构化数据
💡 构建定时爬取流水线监控目标网站的数据变化

优势与不足

优势

  • 活跃维护,近期持续更新
  • 社区热度高(25.7k stars)
  • 开源许可证友好(Apache-2.0)
  • Issue 响应及时,积压少

快速开始

npx crawlee create my-crawler
cd my-crawler
npm start

相关项目

Parsr

6.2k · JavaScript
不活跃 B

将 PDF、文档和图片转换为结构化数据的文档处理管道,支持表格识别、阅读顺序还原和 Markdown 输出。

javascriptragtools +2
  • · 多格式文档解析:支持 PDF、DOCX、图片和 EML 文件,轻量级部署
  • · 结构化输出:支持 JSON、Markdown、CSV/Pandas DataFrame 和 TXT 格式
  • · 文档结构检测:标题、表格、列表、目录、页码、页眉/页脚和链接

Docstrange

1.5k · Python
不活跃 B

通用文档格式转换工具,支持从 PDF、图片、Word、PPT 等提取数据并转换为 Markdown、JSON、CSV 等多种格式。

pythonragtools +2
  • · 多格式转换——将 PDF、DOCX、PPTX、XLSX、图片和 URL 转换为 Markdown、JSON、CSV 和 HTML
  • · 7B 参数模型——升级的核心模型,显著提高准确性和对复杂文档的理解能力
  • · 高级 OCR 管道——从扫描文档、手机照片和收据中高精度提取文本

WrenAI

17.5k · Python
活跃 A

WrenAI 是一个开源的 Text-to-SQL 和 Text-to-Chart GenBI Agent,内置语义层,支持用自然语言查询数据库,自动生成 SQL 语句和可视化图表,兼容 PostgreSQL、BigQuery、Snowflake 等十余种数据源。

llmtypescriptagent +2
  • · 开源上下文层,为 AI Agent 提供业务语义、示例和治理能力
  • · Agent 驱动设计,CLI 内置工作流指南按需加载
  • · 建模定义语言(MDL)支持模型、关系、立方体、指标和行级/列级访问控制