Spider

活跃
GitHub Rust MIT

简介

高性能的 Rust 网页爬虫库,专为 AI 数据采集设计,支持无头浏览器与分布式爬取。

核心特性

  • 极致性能 — Rust 实现,单机可处理每秒数千个请求
  • 无头浏览器 — 内置 Chromium 支持,可处理 JS 渲染页面
  • 分布式爬取 — 支持多机协同,分片处理大规模爬取任务
  • 智能反爬 — 自动处理 UA 轮换、代理池、Cookie 管理
  • 结构化提取 — 支持 CSS 选择器、XPath、LLM 提取三种方式
  • 数据管道 — 内置去重、清洗、存储管道,可对接数据库

适用场景

💡 AI 团队用它采集互联网数据构建训练数据集。
💡 研究人员用它批量抓取学术论文、博客内容用于研究。
💡 商业分析团队用它爬取电商、新闻网站数据进行行业分析。

快速开始

```bash
# 安装
cargo install spider_cli

# 快速开始
spider --url https://example.com --output content.md

# 分布式爬取
spider crawl --url https://example.com --depth 3 --workers 10
```

相关项目