Crawlee

活跃
GitHub TypeScript Apache-2.0

简介

Crawlee 是一个面向 Node.js 的 Web 爬取和浏览器自动化库,支持 Puppeteer、Playwright、Cheerio 等多种引擎,专为构建可靠的爬虫而设计,可提取 HTML、PDF 等数据用于 AI、LLM 和 RAG 应用。

核心特性

  • 多引擎统一接口 — 同一 API 支持 Puppeteer、Playwright、Cheerio 和原始 HTTP
  • 反检测伪装 — 默认配置即可模拟人类行为规避主流反爬机制
  • 代理轮换与会话管理 — 内置代理轮换、指纹生成和会话持久化
  • 持久化队列 — 支持广度优先和深度优先的 URL 爬取队列
  • 自动扩展 — 根据系统资源自动调整并发爬取规模
  • 结构化数据存储 — 内置 Dataset 和 KeyValueStore 支持表格和文件存储

适用场景

💡 为 AI/RAG 应用批量抓取网页内容构建知识库数据源
💡 抓取电商平台商品信息用于价格监控和竞品分析
💡 自动化采集新闻网站和社交媒体内容用于舆情分析
💡 从需要 JavaScript 渲染的 SPA 网站提取结构化数据
💡 构建定时爬取流水线监控目标网站的数据变化

快速开始

npx crawlee create my-crawler
cd my-crawler
npm start

相关项目