ShowUI
正常简介
ShowUI 是一个开源的端到端视觉-语言-动作模型,专为 GUI 智能体和计算机使用场景设计,能理解屏幕截图并执行精确的界面操作。
核心特性
- 端到端视觉-语言-动作模型,专为 GUI 交互设计
- UI 引导的 Token 选择将视觉 Token 从 1296 降至约 167
- 支持定位、导航和计算机使用任务
- 兼容 Qwen2-VL 和 Qwen2.5-VL 基础模型
- 训练流水线支持 DeepSpeed、QLoRA、FlashAttention2
- 通过 Gradio Client 进行 API 调用,无需本地 GPU
适用场景
💡 自动化 GUI 测试和质量保证
💡 桌面计算机使用的任务自动化 Agent
💡 跨平台 UI 导航和交互
💡 为特定应用构建自定义 GUI Agent
💡 视觉语言模型在界面理解方面的研究
分类
快速开始
安装依赖,从 HuggingFace 下载 ShowUI-2B 模型,通过 inference_vllm.ipynb 进行推理或使用 python3 api.py 调用 API——截图和查询作为输入,API 模式无需本地 GPU