Firecrawl

活跃
GitHub TypeScript AGPL-3.0

简介

Firecrawl 是一个专为 AI Agent 设计的网页抓取和搜索引擎,支持将任意网页转换为结构化的 Markdown 数据,提供搜索、抓取和清洗功能,适合构建基于网页数据的 AI 应用。

核心特性

  • Search 端点 — 搜索互联网并获取搜索结果页面的完整内容,一步完成搜索+抓取
  • Scrape 端点 — 将任意 URL 转换为 Markdown、HTML、截图或结构化 JSON
  • Interact 端点 — 先抓取页面,再通过 AI 提示词或代码与页面交互(点击、搜索等)
  • Agent 模式 — 只需描述需求,自动完成多步骤的数据采集任务
  • Crawl/Map/Batch — 单次请求爬取整站、快速发现所有 URL、异步批量抓取数千页面
  • MCP 集成 — 一行命令将 Firecrawl 连接为 AI Agent 或 MCP 客户端的网页数据源

适用场景

💡 为 RAG 管道提供实时网页数据源,将抓取内容直接注入向量数据库
💡 构建竞品监控系统,定期抓取并分析竞争对手网站的价格和产品变化
💡 为 AI Agent 提供网页浏览能力,让 Agent 能自主搜索和提取在线信息
💡 批量提取电商产品数据,将商品页面转换为结构化 JSON 用于分析
💡 搭建内容聚合平台,从多个网站自动采集和整理特定领域的最新资讯

快速开始

# 安装 Python SDK
pip install firecrawl-py

# 初始化客户端并抓取页面
from firecrawl import Firecrawl

app = Firecrawl(api_key="fc-YOUR_API_KEY")
result = app.scrape("https://example.com")
print(result.markdown)

相关项目