Speech-to-Speech

活跃
GitHub Python Apache-2.0

简介

HuggingFace 开源的本地语音智能体构建工具,基于开源模型实现端到端的语音对话能力,支持完全本地化部署。

核心特性

  • 完全开源的模块化语音到语音管道:VAD → STT → LLM → TTS
  • 多种STT后端:Whisper、Parakeet TDT(<100ms延迟)、Lightning Whisper MLX
  • 灵活的LLM集成:HuggingFace Transformers、mlx-lm、OpenAI API
  • 多种TTS引擎:ChatTTS、Pocket TTS(语音克隆)、Kokoro-82M、Qwen3-TTS
  • 四种部署模式:实时WebSocket、服务器/客户端、WebSocket和本地
  • Apple Silicon优化支持,MLX加速所有管道阶段

适用场景

💡 构建无需云依赖的本地语音AI智能体
💡 低延迟语音处理的实时对话AI
💡 使用可替换模型组件开发自定义语音智能体
💡 完全离线部署的隐私敏感语音应用
💡 通过快速模型实验进行语音到语音系统原型开发

快速开始

安装:pip install speech-to-speech。运行:speech-to-speech(默认使用Parakeet TDT + OpenAI LLM + Qwen3-TTS)。本地Mac:speech-to-speech --local_mac_optimal_settings。可选后端:pip install "speech-to-speech[kokoro]"。设置OPENAI_API_KEY使用云端LLM。

相关项目