FunASR

活跃
GitHub Python MIT

简介

FunASR 是达摩院开源的工业级语音识别工具包,比 Whisper 快 170 倍,支持 50+ 语言、说话人分离、情感识别,提供 OpenAI 兼容 API 和 MCP 服务。

核心特性

  • 极速识别 — SenseVoice-Small 在 GPU 上以 170 倍实时速度运行,CPU 下亦达 17 倍实时速度
  • 说话人分离与情感识别 — 同一段音频自动标注说话人 ID 和情绪标签(开心/愤怒/中性等)
  • 流式识别 — 基于 WebSocket 的实时流式识别,适合通话质检和实时字幕场景
  • OpenAI 兼容 API 与 MCP — 提供 /v1/audio/transcriptions 端点和 AI Agent MCP 服务器

适用场景

💡 会议录音自动转写并区分发言人,输出结构化字幕文件
💡 在客服质检系统中实时识别通话内容,自动标记异常对话片段
💡 通过 MCP 服务器将语音识别能力接入 Claude/Cursor 等 AI Agent 工具链

优势与不足

优势

  • 活跃维护,近期持续更新
  • 社区热度高(19.8k stars)
  • 开源许可证友好(MIT)
  • 项目有一定历史沉淀(已维护 3 年)

快速开始

# 一行安装
pip install funasr

# 基础语音识别(VAD + 说话人分离 + 时间戳)
from funasr import AutoModel
model = AutoModel(model="iic/SenseVoiceSmall",
                  vad_model="fsmn-vad", spk_model="cam++", device="cuda")
result = model.generate(input="audio.wav")

# 启动 OpenAI 兼容 API 服务
funasr-server --device cuda
# POST /v1/audio/transcriptions

相关项目