Vision Agents
活跃简介
Stream 开源的视觉与语音智能体框架,支持任意模型和视频提供商,利用边缘网络实现超低延迟的实时多模态 AI 交互。
核心特性
- 实时视频 AI,集成 YOLO、Roboflow 并结合 Gemini/OpenAI 进行实时视觉理解
- 通过 Stream 边缘网络实现 30ms 以下超低延迟音视频传输,500ms 内加入
- 原生 SDK 方法来自 OpenAI、Gemini 和 Claude,始终使用最新 LLM 能力
- 可插拔视频处理器管道,支持自定义 PyTorch/ONNX 模型与 LLM 调用
- 多平台 SDK 支持 React、Android、iOS、Flutter、React Native 和 Unity
- 生产就绪:内置 HTTP 服务器、Prometheus 指标、水平扩展和 Kubernetes 部署
适用场景
💡 实时视频教练应用(体育、物理治疗、健身指导)
💡 多模态 AI 助手,可观看、聆听并响应视频流
💡 无人机火灾检测和监控,支持实时视觉 AI 处理
💡 基于电话的语音 Agent,通过 Twilio 集成实现视频理解
快速开始
安装:uv add vision-agents。获取 Stream API 密钥。按照 visionagents.ai 上的快速入门指南构建你的第一个语音或视频 Agent。