ShowUI

正常
GitHub Python Apache-2.0

简介

ShowUI 是一个开源的端到端视觉-语言-动作模型,专为 GUI 智能体和计算机使用场景设计,能理解屏幕截图并执行精确的界面操作。

核心特性

  • 端到端视觉-语言-动作模型,专为 GUI 交互设计
  • UI 引导的 Token 选择将视觉 Token 从 1296 降至约 167
  • 支持定位、导航和计算机使用任务
  • 兼容 Qwen2-VL 和 Qwen2.5-VL 基础模型
  • 训练流水线支持 DeepSpeed、QLoRA、FlashAttention2
  • 通过 Gradio Client 进行 API 调用,无需本地 GPU

适用场景

💡 自动化 GUI 测试和质量保证
💡 桌面计算机使用的任务自动化 Agent
💡 跨平台 UI 导航和交互
💡 为特定应用构建自定义 GUI Agent
💡 视觉语言模型在界面理解方面的研究

快速开始

安装依赖,从 HuggingFace 下载 ShowUI-2B 模型,通过 inference_vllm.ipynb 进行推理或使用 python3 api.py 调用 API——截图和查询作为输入,API 模式无需本地 GPU

相关项目