Speech-to-Speech

活跃
GitHub Python Apache-2.0

简介

HuggingFace 开源的本地语音智能体构建工具,基于开源模型实现端到端的语音对话能力,支持完全本地化部署。

核心特性

  • 完全开源的模块化语音到语音管道:VAD → STT → LLM → TTS
  • 多种STT后端:Whisper、Parakeet TDT(<100ms延迟)、Lightning Whisper MLX
  • 灵活的LLM集成:HuggingFace Transformers、mlx-lm、OpenAI API
  • 多种TTS引擎:ChatTTS、Pocket TTS(语音克隆)、Kokoro-82M、Qwen3-TTS
  • 四种部署模式:实时WebSocket、服务器/客户端、WebSocket和本地
  • Apple Silicon优化支持,MLX加速所有管道阶段

适用场景

💡 构建无需云依赖的本地语音AI智能体
💡 低延迟语音处理的实时对话AI
💡 使用可替换模型组件开发自定义语音智能体
💡 完全离线部署的隐私敏感语音应用
💡 通过快速模型实验进行语音到语音系统原型开发

优势与不足

优势

  • 活跃维护,近期持续更新
  • 社区热度高(13.1k stars)
  • 开源许可证友好(Apache-2.0)
  • 项目有一定历史沉淀(已维护 2 年)

快速开始

安装:pip install speech-to-speech。运行:speech-to-speech(默认使用Parakeet TDT + OpenAI LLM + Qwen3-TTS)。本地Mac:speech-to-speech --local_mac_optimal_settings。可选后端:pip install "speech-to-speech[kokoro]"。设置OPENAI_API_KEY使用云端LLM。

相关项目

Vision Agents

8.1k · Python
活跃 A+

Stream 开源的视觉与语音智能体框架,支持任意模型和视频提供商,利用边缘网络实现超低延迟的实时多模态 AI 交互。

voiceagentpython +3
  • · 实时视频 AI,集成 YOLO、Roboflow 并结合 Gemini/OpenAI 进行实时视觉理解
  • · 通过 Stream 边缘网络实现 30ms 以下超低延迟音视频传输,500ms 内加入
  • · 原生 SDK 方法来自 OpenAI、Gemini 和 Claude,始终使用最新 LLM 能力

LangExtract

38.5k · Python
活跃 A+

Google 开源的 Python 库,用于利用 LLM 从非结构化文本中精确提取结构化信息,支持源文本标注和交互式可视化,适用于数据标注和知识抽取场景。

data-processingllmpython +2
  • · 精确源文本锚定 — 每条提取结果映射到原文精确位置,支持视觉高亮追溯验证
  • · 受控结构化输出 — 基于 few-shot 示例强制一致输出 Schema,利用 Gemini 受控生成保证结果鲁棒性
  • · 长文档优化策略 — 通过文本分块、并行处理和多轮扫描克服大文档「大海捞针」问题,提升召回率

GPT4All

77.4k · C++
不活跃 B

在任意设备上运行本地大语言模型的开源工具,支持商业使用,为 AI Agent 提供完全离线的本地推理和对话能力。

pythonllmagent +3
  • · 完全离线本地推理 — 无需 API 调用或 GPU,在普通笔记本和台式机上私有运行大语言模型
  • · 跨平台桌面应用 — 提供 Windows、macOS 和 Linux 原生安装程序,下载即用
  • · Python SDK 集成 — 通过 gpt4all Python 包封装 llama.cpp,几行代码即可加载模型并推理