Scrapling

活跃
GitHub Python BSD-3-Clause

简介

自适应 Web 爬虫框架,智能应对反爬机制,从单次请求到大规模爬取均可处理,专为 AI Agent 数据采集设计。

核心特性

  • 自适应选择器 — 解析器学习网站结构变化,自动重新定位元素,即使页面更新也能找到数据
  • 反爬虫绕过 — 内置 StealthyFetcher 和 DynamicFetcher,可绕过 Cloudflare Turnstile 等反机器人系统
  • 多模式 Fetcher — 提供 Fetcher、AsyncFetcher、StealthyFetcher、DynamicFetcher 四种模式适应不同场景
  • 大规模爬虫框架 — Spider 框架支持并发多会话爬取,支持暂停/恢复和自动代理轮换
  • 实时统计与流式输出 — 支持实时爬取统计和流式数据输出,监控大规模爬取进度
  • AI Agent 集成 — 提供 Agent Skill 和 MCP 服务器,可直接被 AI Agent 调用进行数据采集

适用场景

💡 采集电商网站商品价格和库存数据,自适应页面改版无需频繁维护选择器
💡 为 AI Agent 提供实时网页数据采集能力,通过 MCP 服务器直接调用
💡 大规模爬取目标网站内容,使用代理轮换和并发控制避免被封禁
💡 监控竞品网站变化,自适应检测页面结构更新并自动调整解析规则
💡 构建数据管道,从多个来源持续采集数据并流式传输到下游系统

优势与不足

优势

  • 活跃维护,近期持续更新
  • 社区热度高(79.4k stars)
  • 开源许可证友好(BSD-3-Clause)
  • Issue 响应及时,积压少

快速开始

pip install scrapling

from scrapling.fetchers import Fetcher, StealthyFetcher

# 基本获取
page = Fetcher.get('https://example.com')
products = page.css('.product')

# 使用隐身模式绕过反爬虫
StealthyFetcher.adaptive = True
page = StealthyFetcher.fetch(
    'https://example.com',
    headless=True,
    network_idle=True
)
products = page.css('.product', auto_save=True)

相关项目

Agent Reach

78.9k · Python
活跃 A+

为 AI Agent 赋予全网搜索能力,一键读取和搜索 Twitter、Reddit、YouTube、GitHub、B 站、小红书等平台,无需 API 费用。

browserpythonagent +2
  • · 全平台搜索 — 一键搜索 Twitter、Reddit、YouTube、GitHub、B站、小红书等 14+ 平台
  • · 零 API 费用 — 所有工具开源免费,无需为各平台 API 付费
  • · 一键安装 — 复制一句话给 AI Agent 即可完成安装,支持 Claude Code、OpenClaw、Cursor 等

PPT Master

53.1k · Python
活跃 A+

AI 驱动的 PPT 生成工具,从任意文档自动生成原生可编辑的 PPTX 文件,输出真正的 PowerPoint 图形元素而非图片。

browserpythonagent +2
  • · 原生 PPTX 生成 — 输出真正的 PowerPoint 图形元素而非图片,可直接在 PowerPoint 中编辑
  • · 文档输入解析 — 支持 Markdown、PDF、Word 等多种文档格式自动解析为幻灯片内容
  • · 多风格模板 — 内置 Swiss Grid、Glassmorphism、Memphis Pop 等专业设计风格

相关文章