Crawl4AI

不活跃
GitHub Python Apache-2.0

简介

Crawl4AI 是面向 LLM 与 Agent 的网页抓取工具,提供结构化提取、站点遍历、内容清洗与爬取控制能力,适合作为 Agent 获取外部网页知识的入口层。

核心特性

  • LLM 友好内容提取 — 将网页 HTML 清洗为适合大模型消费的 Markdown 或结构化数据
  • 批量异步爬取 — 支持并发抓取多个 URL,自动处理速率限制和反爬机制
  • 深度站点遍历 — 递归发现和抓取网站子页面,自动构建站点地图
  • 自定义爬取策略 — 可配置 CSS 选择器、XPath、请求头、Cookie 等精细控制
  • 浏览器渲染支持 — 集成 Playwright 处理 JavaScript 渲染的动态页面
  • 内容清洗管线 — 自动去除导航栏、广告、页脚等无关内容,保留正文

适用场景

💡 为 RAG 系统构建高质量网页知识库
💡 批量抓取竞品网站内容用于市场分析
💡 抓取技术文档构建开发者知识检索系统
💡 监控价格或内容变化的定时爬取任务
💡 提取社交媒体或论坛内容用于趋势分析

快速开始

pip install crawl4ai

import asyncio
from crawl4ai import AsyncWebCrawler

async def main():
    async with AsyncWebCrawler() as crawler:
        result = await crawler.arun(
            url="https://docs.crawl4ai.com",
            word_count_threshold=10,
            bypass_cache=True
        )
        print(result.markdown[:500])

asyncio.run(main())

相关项目