Scrapling
活跃简介
自适应 Web 爬虫框架,智能应对反爬机制,从单次请求到大规模爬取均可处理,专为 AI Agent 数据采集设计。
核心特性
- 自适应选择器 — 解析器学习网站结构变化,自动重新定位元素,即使页面更新也能找到数据
- 反爬虫绕过 — 内置 StealthyFetcher 和 DynamicFetcher,可绕过 Cloudflare Turnstile 等反机器人系统
- 多模式 Fetcher — 提供 Fetcher、AsyncFetcher、StealthyFetcher、DynamicFetcher 四种模式适应不同场景
- 大规模爬虫框架 — Spider 框架支持并发多会话爬取,支持暂停/恢复和自动代理轮换
- 实时统计与流式输出 — 支持实时爬取统计和流式数据输出,监控大规模爬取进度
- AI Agent 集成 — 提供 Agent Skill 和 MCP 服务器,可直接被 AI Agent 调用进行数据采集
适用场景
💡 采集电商网站商品价格和库存数据,自适应页面改版无需频繁维护选择器
💡 为 AI Agent 提供实时网页数据采集能力,通过 MCP 服务器直接调用
💡 大规模爬取目标网站内容,使用代理轮换和并发控制避免被封禁
💡 监控竞品网站变化,自适应检测页面结构更新并自动调整解析规则
💡 构建数据管道,从多个来源持续采集数据并流式传输到下游系统
分类
快速开始
pip install scrapling
from scrapling.fetchers import Fetcher, StealthyFetcher
# 基本获取
page = Fetcher.get('https://example.com')
products = page.css('.product')
# 使用隐身模式绕过反爬虫
StealthyFetcher.adaptive = True
page = StealthyFetcher.fetch(
'https://example.com',
headless=True,
network_idle=True
)
products = page.css('.product', auto_save=True)