FunASR
活跃简介
FunASR 是达摩院开源的工业级语音识别工具包,比 Whisper 快 170 倍,支持 50+ 语言、说话人分离、情感识别,提供 OpenAI 兼容 API 和 MCP 服务。
核心特性
- 极速识别 — SenseVoice-Small 在 GPU 上以 170 倍实时速度运行,CPU 下亦达 17 倍实时速度
- 说话人分离与情感识别 — 同一段音频自动标注说话人 ID 和情绪标签(开心/愤怒/中性等)
- 流式识别 — 基于 WebSocket 的实时流式识别,适合通话质检和实时字幕场景
- OpenAI 兼容 API 与 MCP — 提供 /v1/audio/transcriptions 端点和 AI Agent MCP 服务器
适用场景
💡 会议录音自动转写并区分发言人,输出结构化字幕文件
💡 在客服质检系统中实时识别通话内容,自动标记异常对话片段
💡 通过 MCP 服务器将语音识别能力接入 Claude/Cursor 等 AI Agent 工具链
优势与不足
✅ 优势
- • 活跃维护,近期持续更新
- • 社区热度高(19.8k stars)
- • 开源许可证友好(MIT)
- • 项目有一定历史沉淀(已维护 3 年)
分类
快速开始
# 一行安装
pip install funasr
# 基础语音识别(VAD + 说话人分离 + 时间戳)
from funasr import AutoModel
model = AutoModel(model="iic/SenseVoiceSmall",
vad_model="fsmn-vad", spk_model="cam++", device="cuda")
result = model.generate(input="audio.wav")
# 启动 OpenAI 兼容 API 服务
funasr-server --device cuda
# POST /v1/audio/transcriptions