VibeVoice

活跃
GitHub Python MIT

简介

微软开源的前沿语音 AI 平台,提供高质量的语音合成和语音识别能力,支持构建实时对话式语音 Agent 应用。

核心特性

  • 60分钟长音频单次处理 — ASR模型一次处理最长60分钟连续音频,保持全程说话人追踪和语义连贯
  • 结构化转录输出 — 同时生成说话人身份、时间戳和文字内容(Who/When/What),无需后处理
  • 自定义热词引导 — 支持提供专有名词和领域术语作为热词,显著提升专业内容识别准确率
  • 90分钟多说话人TTS — 单次合成最长90分钟对话语音,最多支持4个不同说话人
  • 连续语音分词器 — 采用7.5Hz超低帧率的声学和语义分词器,在保持音质的同时大幅提升计算效率
  • 实时流式TTS — 支持流式文本输入和实时语音生成,适用于对话式Agent场景

适用场景

💡 会议录音自动转写:将长达一小时的会议录音自动转换为带有说话人标识和时间戳的文字稿
💡 播客和有声内容生成:利用多说话人TTS合成长篇对话式播客或有声书内容
💡 实时语音Agent构建:基于流式TTS和ASR能力构建支持实时语音交互的AI Agent
💡 多语言语音识别:支持50+语言的长音频转录,适用于跨国会议和多语种内容处理

快速开始

# 安装依赖
pip install torch torchaudio
pip install git+https://github.com/microsoft/VibeVoice.git

# ASR转录示例
from vibevoice.asr import VibeVoiceASR

model = VibeVoiceASR.from_pretrained("microsoft/VibeVoice-ASR")
result = model.transcribe("meeting_recording.wav")
print(result.text)

相关项目

相关文章