Speech-to-Speech
活跃简介
HuggingFace 开源的本地语音智能体构建工具,基于开源模型实现端到端的语音对话能力,支持完全本地化部署。
核心特性
- 完全开源的模块化语音到语音管道:VAD → STT → LLM → TTS
- 多种STT后端:Whisper、Parakeet TDT(<100ms延迟)、Lightning Whisper MLX
- 灵活的LLM集成:HuggingFace Transformers、mlx-lm、OpenAI API
- 多种TTS引擎:ChatTTS、Pocket TTS(语音克隆)、Kokoro-82M、Qwen3-TTS
- 四种部署模式:实时WebSocket、服务器/客户端、WebSocket和本地
- Apple Silicon优化支持,MLX加速所有管道阶段
适用场景
💡 构建无需云依赖的本地语音AI智能体
💡 低延迟语音处理的实时对话AI
💡 使用可替换模型组件开发自定义语音智能体
💡 完全离线部署的隐私敏感语音应用
💡 通过快速模型实验进行语音到语音系统原型开发
分类
快速开始
安装:pip install speech-to-speech。运行:speech-to-speech(默认使用Parakeet TDT + OpenAI LLM + Qwen3-TTS)。本地Mac:speech-to-speech --local_mac_optimal_settings。可选后端:pip install "speech-to-speech[kokoro]"。设置OPENAI_API_KEY使用云端LLM。