🌐

浏览器 Agent

浏览器与 Web 自动化 Agent,包括 Browser-use、Playwright MCP、Skyvern 等,结合 LLM 视觉与 DOM 操作,实现网页数据提取、表单填写、端到端测试等任务。

110 个项目

Firecrawl

178.0k · TypeScript
活跃 A+

Firecrawl 是一个专为 AI Agent 设计的网页抓取和搜索引擎,支持将任意网页转换为结构化的 Markdown 数据,提供搜索、抓取和清洗功能,适合构建基于网页数据的 AI 应用。

web-scrapingsearch-enginemarkdown +2
  • · Search 端点 — 搜索互联网并获取搜索结果页面的完整内容,一步完成搜索+抓取
  • · Scrape 端点 — 将任意 URL 转换为 Markdown、HTML、截图或结构化 JSON
  • · Interact 端点 — 先抓取页面,再通过 AI 提示词或代码与页面交互(点击、搜索等)

browser-use

113.5k · Python
活跃 A+

browser-use 提供浏览器自动化 Agent 能力,让 LLM 可以理解页面并执行复杂网页操作。

browseragentautomation +1
  • · LLM 驱动浏览器自动化 — 让大语言模型理解网页内容并执行点击、输入、导航等操作
  • · 多模型支持 — 内置 ChatBrowserUse,同时支持 Gemini、Claude、GPT 等主流模型
  • · CLI 命令行工具 — 提供 open/state/click/type/screenshot 等命令实现快速浏览器控制

Scrapling

79.4k · Python
活跃 A+

自适应 Web 爬虫框架,智能应对反爬机制,从单次请求到大规模爬取均可处理,专为 AI Agent 数据采集设计。

browserpythontools +2
  • · 自适应选择器 — 解析器学习网站结构变化,自动重新定位元素,即使页面更新也能找到数据
  • · 反爬虫绕过 — 内置 StealthyFetcher 和 DynamicFetcher,可绕过 Cloudflare Turnstile 等反机器人系统
  • · 多模式 Fetcher — 提供 Fetcher、AsyncFetcher、StealthyFetcher、DynamicFetcher 四种模式适应不同场景

Agent Reach

78.9k · Python
活跃 A+

为 AI Agent 赋予全网搜索能力,一键读取和搜索 Twitter、Reddit、YouTube、GitHub、B 站、小红书等平台,无需 API 费用。

browserpythonagent +2
  • · 全平台搜索 — 一键搜索 Twitter、Reddit、YouTube、GitHub、B站、小红书等 14+ 平台
  • · 零 API 费用 — 所有工具开源免费,无需为各平台 API 付费
  • · 一键安装 — 复制一句话给 AI Agent 即可完成安装,支持 Claude Code、OpenClaw、Cursor 等

Front-End Checklist

74.1k · MDX
活跃 A

专为现代 Web 开发和 AI 代理设计的详尽前端检查清单,覆盖 HTML/CSS/JS、性能、可访问性、SEO 等全链路质量标准。

front-endchecklistweb-development +2
  • · 完整质量检查项 — 涵盖 HTML、CSS、JavaScript、图片、字体、性能、可访问性、SEO、安全等 20+ 类别
  • · AI 代理友好 — 每个项目都有清晰的检查提示词,可直接喂给 LLM 做自动化质检
  • · 多语言支持 — 提供中文、英文、葡萄牙文等多个语言版本,覆盖全球开发者

PPT Master

53.1k · Python
活跃 A+

AI 驱动的 PPT 生成工具,从任意文档自动生成原生可编辑的 PPTX 文件,输出真正的 PowerPoint 图形元素而非图片。

browserpythonagent +2
  • · 原生 PPTX 生成 — 输出真正的 PowerPoint 图形元素而非图片,可直接在 PowerPoint 中编辑
  • · 文档输入解析 — 支持 Markdown、PDF、Word 等多种文档格式自动解析为幻灯片内容
  • · 多风格模板 — 内置 Swiss Grid、Glassmorphism、Memphis Pop 等专业设计风格

Chrome DevTools MCP

51.4k · TypeScript
活跃 A+

为编程 Agent 提供浏览器开发者工具能力的 MCP 服务器,支持网页调试、性能分析和 DOM 操作自动化。

mcpchrome-devtoolsbrowser-debug +2
  • · 性能分析洞察 — 录制 Chrome 性能追踪并提取可操作的性能优化建议
  • · 高级浏览器调试 — 分析网络请求、截图、检查控制台消息及 source-mapped 堆栈跟踪
  • · 可靠自动化 — 基于 Puppeteer 的浏览器自动化,自动等待操作结果

GitNexus

47.2k · TypeScript
活跃 A

零服务器代码智能引擎,完全在浏览器中运行的客户端知识图谱创建工具,内置 Graph RAG 智能体用于代码探索。

browseragentrag +2
  • · 代码知识图谱 — 将代码库索引为知识图谱,追踪每个依赖、调用链和执行流程
  • · MCP 智能工具 — 通过 MCP 协议为 AI 代理提供深度代码架构视图
  • · CLI + Web UI — CLI 用于本地索引和 MCP 服务,Web UI 用于可视化图谱探索

UI-TARS Desktop

38.9k · TypeScript
正常 A

字节跳动开源的多模态 AI Agent 栈,连接前沿 AI 模型与 Agent 基础设施,支持 GUI 自动化和电脑操作。

multimodal-agentgui-automationcomputer-use +2
  • · 多模态 AI Agent 栈 — Agent TARS + UI-TARS Desktop 双项目架构,覆盖 CLI、Web UI 和桌面端
  • · GUI 自动化 — 基于 UI-TARS 模型实现桌面和浏览器的原生 GUI 操控
  • · MCP 工具集成 — 无缝对接外部 MCP 服务器扩展工具能力

Lightpanda Browser

35.2k · Zig
活跃 A+

Lightpanda Browser 是面向自动化和爬取场景的轻量浏览器运行时,目标是在无头任务中提供比传统浏览器更低的资源开销。它适合大规模 Web Agent、网页抽取和自动化测试,把浏览器能力嵌入后端工作流。

headless-browserautomationweb-agent
  • · 从零构建的浏览器 — 非 Chromium/WebKit 分支,使用 Zig 语言从头开发的无头浏览器
  • · 极低资源占用 — 峰值内存仅 123MB(Chrome 需 2GB),100 页执行时间 5s(Chrome 需 46s),快 9 倍
  • · CDP 兼容 — 支持 Chrome DevTools Protocol,可直接配合 Puppeteer、Playwright 使用

CloakBrowser

31.3k · Python
活跃 A+

CloakBrowser 是基于源码级补丁构建的反检测 Chromium 浏览器,专为 AI 代理和爬虫场景,绕过 Cloudflare、reCAPTCHA 等主流反机器人检测。

browseranti-detectchromium +3
  • · 源码级 C++ 补丁 — 直接修改 Chromium 二进制,覆盖 canvas、WebGL、音频、字体、GPU、WebRTC 等指纹信号
  • · 一键 humanize — 内置类人鼠标轨迹、键盘时序与滚动行为,应对行为检测
  • · Playwright/Puppeteer 兼容 — Python 和 JavaScript 双绑定,迁移仅需改一行 import

AIHawk

30.3k · Python
活跃 A+

开源 AI 浏览器智能体,驱动反检测 Firefox 像人一样操作网页,一句自然语言即可让它点击、输入、读页完成任务,并可经 MCP 接入主流编码助手。

browser-agentweb-automationmcp +2
  • · 真人式浏览 — 指针移动、按键输入,拒绝用 JavaScript 直填表单,页面难以分辨
  • · 双通道使用 — 经 MCP 服务器接入 Claude Code、Codex、Gemini CLI 等,或用自带 Web UI 独立运行
  • · 隐身引擎 — 修补版 Firefox 支持代理、固定 seed 的稳定身份与可持久化 profile

Page Agent

29.0k · TypeScript
活跃 A+

Page Agent 是阿里巴巴开发的 JavaScript 页面内 GUI 智能体,通过自然语言控制网页界面,实现自动化表单填写、页面导航和元素操作等任务。

browseragenttypescript +2
  • · 页面内JavaScript GUI智能体,无需浏览器扩展、Python或无头浏览器
  • · 基于文本的DOM操作,不依赖截图或多模态大模型
  • · 自带LLM,兼容任何OpenAI兼容API

AgenticSeek

27.2k · Python
活跃 A+

完全本地化的 Manus AI 替代方案,支持自主浏览网页、编写代码和语音交互,无需任何 API 费用

browser-agentcoding-agentlocal-ai +3
  • · 完全本地运行 — 所有数据保留在本机,零API费用,无需云端依赖
  • · 自主网页浏览 — 自动搜索、阅读、提取信息和填写表单
  • · 编码助手 — 支持Python、C、Go、Java等多种语言的编写和调试

Open-AutoGLM

26.2k · Python
不活跃 C

Open-AutoGLM 是一个开放的手机 Agent 模型与框架,支持 AI 自主操控手机界面完成任务,解锁 AI Phone 体验。

phone-agentgui-agentagent-framework +2
  • · 多模态屏幕理解 — 通过视觉语言模型(VLM)感知手机屏幕内容,理解当前界面状态
  • · ADB/HDC 设备控制 — 通过 Android Debug Bridge 和 HarmonyOS HDC 控制 Android 和鸿蒙设备
  • · 自然语言任务规划 — 用户用自然语言描述需求,系统自动解析意图并规划操作流程

Stagehand

24.2k · TypeScript
活跃 A+

Stagehand 是 Browserbase 推出的浏览器 Agent SDK,为 AI 编码助手提供网页操作能力。支持 act、extract、observe 三种核心原语,让 AI Agent 能够自然地浏览和操作网页,是构建浏览器 Agent 的首选工具。

browser-agentsdkweb-automation +2
  • · 三原语 API — act(执行动作)、extract(提取数据)、observe(观察页面)三种核心操作
  • · 自然语言与代码混合 — 在同一工作流中自由切换 AI 驱动和确定性代码控制
  • · 自动缓存与自愈 — 重复操作自动缓存跳过 LLM 推理,页面变化时自动修复

Skyvern

23.0k · Python
活跃 A+

Skyvern 是面向浏览器任务自动化的 Agent 平台,通过页面理解与操作规划完成复杂网页流程,适合表单处理、后台操作与可重复 Web 自动化场景。

browserautomationweb +1
  • · 视觉 LLM 驱动 — 使用视觉大模型理解网页并执行操作,无需预定义 XPath
  • · Playwright 兼容 SDK — 在 Playwright 基础上添加 AI 功能,支持 Python 和 TypeScript
  • · 无代码工作流构建器 — 提供可视化界面,非技术人员也可创建自动化流程

Automa

21.6k · Vue
不活跃 C

Automa 是一款开源浏览器自动化扩展,通过可视化积木块拼接完成表单填写、网页抓取、定时任务等重复操作,让非编程用户也能快速搭建浏览器工作流。

browser-automationchrome-extensionworkflow +2
  • · 可视化积木块 — 通过拖拽方式组合触发器、动作与数据流节点
  • · 表单自动填写 — 支持根据规则或数据源批量填写表单字段
  • · 网页数据抓取 — 提取文本、属性、表格等内容导出为 CSV/JSON

(24 / 110)

相关文章

rate limitingcost controlprompt injection

Agent 速率限制与成本攻击防御:Token 配额、滑动窗口、攻击向量实战

系统讲解 LLM Agent 在生产环境中的速率限制(Rate Limiting)与成本攻击(Cost Attack)防御:从单用户 Token 配额、多租户滑动窗口、Prompt 注入放大成本,到 DDoS 防护与 LangChain/CrewAI/AutoGen 框架的集成。

Web Scraping反爬Browser Fingerprint

反爬与浏览器指纹:现代 Web 抓取策略

系统讲解现代 Web 抓取的反爬对抗:HTTP 层(curl_cffi 模拟 TLS 指纹)+ 浏览器层(Playwright + stealth 隐藏自动化痕迹)+ 行为层(人类行为模拟),覆盖 Cloudflare 绕过、代理 IP、Scrapling 选择器自愈与合法合规边界。

browser agentbrowser-usestagehand

Browser Agent 数据提取与表单填写实战:从 LLM 视觉到 DOM 选择器

系统讲解 Browser Agent 在两类高频任务(结构化数据提取 + 表单自动填写)上的工程实践,对比视觉 LLM、DOM 选择器、混合坐标三种动作定位策略,以及 Browser-Use、Stagehand、Playwright MCP、Skyvern 四大框架的取舍。

Browser AgentWeb 自动化Playwright

Browser Agent 实战:让 AI 操控浏览器的架构与陷阱

从裸 Playwright 到结构化提取,拆解三层浏览器自动化抽象的适用场景、生产模式和常见踩坑。

browser-useWeb AutomationAgent

Web 自动化 Agent 实战:browser-use 的能力边界与最佳实践

详解 browser-use 在网页任务自动化中的优势与限制,并给出稳定执行和失败恢复策略。

deep-researchagent-architectureiterative-retrieval

Deep Research Agent 架构实战:从单轮搜索到迭代推理

拆解五个开源 Deep Research 项目的迭代检索、事实验证、报告生成三大子阶段,附可复制的 query 改造代码。