Scrapling

活跃
GitHub Python BSD-3-Clause

简介

自适应 Web 爬虫框架,智能应对反爬机制,从单次请求到大规模爬取均可处理,专为 AI Agent 数据采集设计。

核心特性

  • 自适应选择器 — 解析器学习网站结构变化,自动重新定位元素,即使页面更新也能找到数据
  • 反爬虫绕过 — 内置 StealthyFetcher 和 DynamicFetcher,可绕过 Cloudflare Turnstile 等反机器人系统
  • 多模式 Fetcher — 提供 Fetcher、AsyncFetcher、StealthyFetcher、DynamicFetcher 四种模式适应不同场景
  • 大规模爬虫框架 — Spider 框架支持并发多会话爬取,支持暂停/恢复和自动代理轮换
  • 实时统计与流式输出 — 支持实时爬取统计和流式数据输出,监控大规模爬取进度
  • AI Agent 集成 — 提供 Agent Skill 和 MCP 服务器,可直接被 AI Agent 调用进行数据采集

适用场景

💡 采集电商网站商品价格和库存数据,自适应页面改版无需频繁维护选择器
💡 为 AI Agent 提供实时网页数据采集能力,通过 MCP 服务器直接调用
💡 大规模爬取目标网站内容,使用代理轮换和并发控制避免被封禁
💡 监控竞品网站变化,自适应检测页面结构更新并自动调整解析规则
💡 构建数据管道,从多个来源持续采集数据并流式传输到下游系统

快速开始

pip install scrapling

from scrapling.fetchers import Fetcher, StealthyFetcher

# 基本获取
page = Fetcher.get('https://example.com')
products = page.css('.product')

# 使用隐身模式绕过反爬虫
StealthyFetcher.adaptive = True
page = StealthyFetcher.fetch(
    'https://example.com',
    headless=True,
    network_idle=True
)
products = page.css('.product', auto_save=True)

相关项目

相关文章