Crawlee Python

活跃
GitHub Python Apache-2.0

简介

Crawlee Python 是 Apify 出品的网页抓取与浏览器自动化库,专注可靠的数据采集与爬虫场景。

核心特性

  • 统一 API,支持 HTTP 抓取、无头浏览器和基于 Playwright 的爬虫
  • 自动请求队列、重试、限速和代理轮换
  • 可插拔的 HTTP 客户端:httpx、curl-impersonate 和原始 socket
  • 浏览器指纹管理与隐身模式,绕过反爬虫防护
  • 数据集和 KV 存储集成,方便结构化保存抓取结果
  • 与 Apify 平台原生集成,可一键部署爬虫到云端

适用场景

💡 为电商价格监控构建生产级网页爬虫
💡 抓取需要真实浏览器的 JavaScript 渲染页面
💡 为 RAG 流水线和下游 LLM Agent 喂入结构化网页数据
💡 编写长时间可靠运行的爬虫,自带重试和代理管理
💡 把现有 Node.js Crawlee 项目迁移到 Python,保持相同心智模型

优势与不足

优势

  • 活跃维护,近期持续更新
  • 社区热度高(9.4k stars)
  • 开源许可证友好(Apache-2.0)
  • 项目有一定历史沉淀(已维护 2 年)

快速开始

pip install crawlee
from crawlee.playwright_crawler import PlaywrightCrawler
crawler = PlaywrightCrawler()
@crawler.router.default_handler
async def handle(context):
    await context.page.goto(context.request.url)
    title = await context.page.title()
    await context.push_data({"url": context.request.url, "title": title})
await crawler.run(["https://example.com"])

相关项目

Firecrawl

168.2k · TypeScript
活跃 A+

Firecrawl 是一个专为 AI Agent 设计的网页抓取和搜索引擎,支持将任意网页转换为结构化的 Markdown 数据,提供搜索、抓取和清洗功能,适合构建基于网页数据的 AI 应用。

web-scrapingsearch-enginemarkdown +2
  • · Search 端点 — 搜索互联网并获取搜索结果页面的完整内容,一步完成搜索+抓取
  • · Scrape 端点 — 将任意 URL 转换为 Markdown、HTML、截图或结构化 JSON
  • · Interact 端点 — 先抓取页面,再通过 AI 提示词或代码与页面交互(点击、搜索等)

Vision Agents

8.1k · Python
活跃 A+

Stream 开源的视觉与语音智能体框架,支持任意模型和视频提供商,利用边缘网络实现超低延迟的实时多模态 AI 交互。

voiceagentpython +3
  • · 实时视频 AI,集成 YOLO、Roboflow 并结合 Gemini/OpenAI 进行实时视觉理解
  • · 通过 Stream 边缘网络实现 30ms 以下超低延迟音视频传输,500ms 内加入
  • · 原生 SDK 方法来自 OpenAI、Gemini 和 Claude,始终使用最新 LLM 能力

Maxun

17.2k · TypeScript
活跃 A+

Maxun 是开源的无代码网页数据平台,支持录制式抓取与 LLM 自然语言抽取,可将任意网站转为结构化 API 与定时任务。

web-scrapingno-codeplaywright +3
  • · 录制式抓取 — 录制浏览器操作自动生成可复用的抽取机器人
  • · LLM 自然语言抽取 — 用自然语言描述目标,由大模型驱动结构化抽取
  • · 多模式爬虫 — Extract / Scrape / Crawl / Search 四类机器人覆盖常见数据需求