Vision Agents

活跃
GitHub Python Apache-2.0

简介

Stream 开源的视觉与语音智能体框架,支持任意模型和视频提供商,利用边缘网络实现超低延迟的实时多模态 AI 交互。

核心特性

  • 实时视频 AI,集成 YOLO、Roboflow 并结合 Gemini/OpenAI 进行实时视觉理解
  • 通过 Stream 边缘网络实现 30ms 以下超低延迟音视频传输,500ms 内加入
  • 原生 SDK 方法来自 OpenAI、Gemini 和 Claude,始终使用最新 LLM 能力
  • 可插拔视频处理器管道,支持自定义 PyTorch/ONNX 模型与 LLM 调用
  • 多平台 SDK 支持 React、Android、iOS、Flutter、React Native 和 Unity
  • 生产就绪:内置 HTTP 服务器、Prometheus 指标、水平扩展和 Kubernetes 部署

适用场景

💡 实时视频教练应用(体育、物理治疗、健身指导)
💡 多模态 AI 助手,可观看、聆听并响应视频流
💡 无人机火灾检测和监控,支持实时视觉 AI 处理
💡 基于电话的语音 Agent,通过 Twilio 集成实现视频理解

优势与不足

优势

  • 活跃维护,近期持续更新
  • 社区热度高(8.1k stars)
  • 开源许可证友好(Apache-2.0)
  • Issue 响应及时,积压少

快速开始

安装:uv add vision-agents。获取 Stream API 密钥。按照 visionagents.ai 上的快速入门指南构建你的第一个语音或视频 Agent。

相关项目

MiroThinker

8.4k · Python
正常 A

专为复杂研究和预测任务优化的深度研究 Agent 框架,其 MiroThinker-1.7 和 MiroThinker-H1 模型在 BrowseComp 基准上分别达到 74.0 和 88.2 分,支持多步骤推理和信息检索。

pythonagentllm +3
  • · 专为复杂研究和预测任务优化的深度研究 Agent 框架
  • · MiroThinker-1.7 模型在 BrowseComp 基准达到 74.0 分,H1 模型达到 88.2 分
  • · 支持 256K 上下文窗口和每次任务最多 300 次工具调用

Tongyi DeepResearch

19.9k · Python
不活跃 B

阿里巴巴通义实验室开源的深度研究 Agent,采用多阶段迭代式信息检索和推理架构,能够对复杂问题进行深度分析、综合和总结,支持网页搜索和文档分析。

pythonagentllm +3
  • · 30.5B 总参数的智能体 LLM,每 token 仅激活 3.3B 参数(MoE 架构)
  • · 全自动合成数据生成流水线,支持智能体预训练、SFT 和强化学习
  • · 基于多样化智能体交互数据的大规模持续预训练