OmniParser

活跃
GitHub Jupyter Notebook CC-BY-4.0

简介

OmniParser 是微软开源的屏幕解析工具,把 GUI 截图解析为结构化元素,使纯视觉 Agent 能可靠地操作界面。

核心特性

  • 纯视觉 — 不依赖 UI 树或 DOM,直接从截图理解
  • 结构化输出 — 解析为可识别的图标与文本区域
  • 可与 GPT-4V 集成 — 给视觉模型提供精确坐标
  • 提升 GUI Agent 能力 — 让模型能可靠点击
  • 开源可微调 — 模型与代码全部开源
  • 多场景适用 — Web、桌面、移动应用通用

适用场景

💡 为视觉 GUI Agent 提供屏幕解析能力
💡 在桌面/Web 应用上做无障碍与自动化
💡 把不可解析的旧应用接入 Agent 工作流
💡 对截图训练标注数据生成管线

优势与不足

优势

  • 活跃维护,近期持续更新
  • 社区热度高(25.3k stars)
  • Issue 响应及时,积压少

⚠️ 不足

  • 缺少明确的开源许可证

快速开始

('# 安装并启动 OmniParser Demo', '# 解析 GUI 截图')
git clone https://github.com/microsoft/OmniParser.git
cd OmniParser
pip install -r requirements.txt
python gradio_demo.py

相关项目

Agent S

12.2k · Python
活跃 A+

开源的计算机使用 Agent 框架,像人类一样操作图形界面完成复杂任务,支持自主学习和经验积累。

computer-usegui-agentautomation +1
  • · 首个在 OSWorld 基准测试中超越人类水平(72.60%)的开源框架
  • · 跨平台支持 Linux、macOS 和 Windows,通过单显示器进行 GUI 交互
  • · 模块化 grounding 模块,支持 UI-TARS-1.5-7B 及多种 LLM 后端(OpenAI、Anthropic、Gemini)

Chrome DevTools MCP

49.3k · TypeScript
活跃 A+

为编程 Agent 提供浏览器开发者工具能力的 MCP 服务器,支持网页调试、性能分析和 DOM 操作自动化。

mcpchrome-devtoolsbrowser-debug +2
  • · 性能分析洞察 — 录制 Chrome 性能追踪并提取可操作的性能优化建议
  • · 高级浏览器调试 — 分析网络请求、截图、检查控制台消息及 source-mapped 堆栈跟踪
  • · 可靠自动化 — 基于 Puppeteer 的浏览器自动化,自动等待操作结果

Vision Agents

8.1k · Python
活跃 A+

Stream 开源的视觉与语音智能体框架,支持任意模型和视频提供商,利用边缘网络实现超低延迟的实时多模态 AI 交互。

voiceagentpython +3
  • · 实时视频 AI,集成 YOLO、Roboflow 并结合 Gemini/OpenAI 进行实时视觉理解
  • · 通过 Stream 边缘网络实现 30ms 以下超低延迟音视频传输,500ms 内加入
  • · 原生 SDK 方法来自 OpenAI、Gemini 和 Claude,始终使用最新 LLM 能力