Spider
活跃简介
高性能的 Rust 网页爬虫库,专为 AI 数据采集设计,支持无头浏览器与分布式爬取。
核心特性
- 极致性能 — Rust 实现,单机可处理每秒数千个请求
- 无头浏览器 — 内置 Chromium 支持,可处理 JS 渲染页面
- 分布式爬取 — 支持多机协同,分片处理大规模爬取任务
- 智能反爬 — 自动处理 UA 轮换、代理池、Cookie 管理
- 结构化提取 — 支持 CSS 选择器、XPath、LLM 提取三种方式
- 数据管道 — 内置去重、清洗、存储管道,可对接数据库
适用场景
💡 AI 团队用它采集互联网数据构建训练数据集。
💡 研究人员用它批量抓取学术论文、博客内容用于研究。
💡 商业分析团队用它爬取电商、新闻网站数据进行行业分析。
快速开始
```bash
# 安装
cargo install spider_cli
# 快速开始
spider --url https://example.com --output content.md
# 分布式爬取
spider crawl --url https://example.com --depth 3 --workers 10
```