Maxun

活跃
GitHub TypeScript AGPL-3.0

简介

Maxun 是开源的无代码网页数据平台,支持录制式抓取与 LLM 自然语言抽取,可将任意网站转为结构化 API 与定时任务。

核心特性

  • 录制式抓取 — 录制浏览器操作自动生成可复用的抽取机器人
  • LLM 自然语言抽取 — 用自然语言描述目标,由大模型驱动结构化抽取
  • 多模式爬虫 — Extract / Scrape / Crawl / Search 四类机器人覆盖常见数据需求
  • 定时与 API 输出 — 支持 cron 调度、RESTful 端点、Sheets/Airtable 导出
  • MCP 集成 — 内置 Model Context Protocol 服务,可被 Claude Desktop 等客户端直接调用
  • 自适应布局变化 — 网站结构变动时自动恢复抽取流程

适用场景

💡 销售线索生成机器人按区域抓取企业目录与联系信息
💡 市场研究 Agent 跨站点聚合竞品价格、库存与评分
💡 为 RAG 流水线持续喂入结构化 Markdown 文档
💡 监控 Agent 按 cron 跟踪监管机构、新闻、社交舆情变化
💡 处理需要登录的 SaaS 仪表盘数据导出(CRM、客服后台)

优势与不足

优势

  • 活跃维护,近期持续更新
  • 社区热度高(17.2k stars)
  • 项目有一定历史沉淀(已维护 2 年)
  • Issue 响应及时,积压少

⚠️ 不足

  • 许可证限制较多(AGPL-3.0)

快速开始

# 启动 docker compose stack
git clone https://github.com/getmaxun/maxun
cd maxun
docker compose up -d

# 或直接使用 SDK 创建机器人
npm install @maxun/sdk
const { Maxun } = require('@maxun/sdk');
const client = new Maxun({ apiKey: 'YOUR_KEY' });
const robot = await client.createExtractRobot({
  url: 'https://example.com',
  selectors: { title: 'h1', price: '.price' }
});
const run = await robot.run();

相关项目

Bright Data MCP

2.6k · JavaScript
活跃 A+

强大的公共 Web 数据访问 MCP 服务器,为 AI 智能体提供一站式网页抓取和结构化数据提取能力。

mcpweb-scrapingdata-extraction +2
  • · 企业级网页访问 — 抓取、搜索和提取数据,不会被反爬虫机制拦截
  • · 每月 5000 次免费请求 — 免费层适用于原型开发和日常 AI 工作流
  • · 多工具组 — 为电商、社交、代码和 GEO 品牌可见性工具提供精选组合

AgentQL

1.4k · Python
活跃 A+

将 AI 连接到 Web 的工具套件,提供查询语言和 Playwright 集成,支持精准、大规模地与网页元素交互和提取数据,包含 REST API 和 Python/JS SDK。

web-scrapingbrowser-automationplaywright +2
  • · AI 驱动的查询语言,用自然语言精准定位网页元素和数据
  • · 与 Playwright 无缝集成,支持 Python 和 JavaScript SDK
  • · 跨网站兼容:同一查询可适用于内容相似的不同网站

Chrome DevTools MCP

49.3k · TypeScript
活跃 A+

为编程 Agent 提供浏览器开发者工具能力的 MCP 服务器,支持网页调试、性能分析和 DOM 操作自动化。

mcpchrome-devtoolsbrowser-debug +2
  • · 性能分析洞察 — 录制 Chrome 性能追踪并提取可操作的性能优化建议
  • · 高级浏览器调试 — 分析网络请求、截图、检查控制台消息及 source-mapped 堆栈跟踪
  • · 可靠自动化 — 基于 Puppeteer 的浏览器自动化,自动等待操作结果