FunASR
免费
FunASR 是阿里通义实验室(Tongyi Lab)开源的工业级语音识别工具包,集 ASR、VAD、标点恢复、说话人分离、情感检测与音频事件识别于一体,提供统一的 Python 接口与 OpenAI 兼容 API,支持 50+ 语言340x 实时率推理,可完全私有化部署。
FunASR:阿里通义实验室开源的工业级语音识别工具包
FunASR 的核心参数与统计
| 项目 | 详细信息 |
|---|---|
| 产品名称 | FunASR (Fun Audio Speech Recognition) |
| 产品类型 | 开源语音识别工具包 |
| 交付形式 | Python SDK / CLI / OpenAI 兼容 API Server / Docker / llama.cpp 边缘部署 |
| 支持语言 | 50+ 语言(Fun-ASR-Nano 支持中/英/日及中文方言;MLT-Nano 支持 31 语种;Qwen3-ASR 支持 52 语种) |
| 模型规模 | 0.4M(fsmn-vad)~ 1.7B(Qwen3-ASR) |
| GitHub Stars | 19.3k |
| 开源协议 | MIT(工具包);模型权重按各自协议授权 |
| 目标用户 | 开发者、企业AI团队、语音产品集成商 |
FunASR 并非一个单一的 SaaS 产品,而是一套完整的开源语音理解工具链。它提供从原始音频到结构化文本的"端到端流水线"——VAD 切分ASR 识别、标点恢复、说话人分离、情感检测、音频事件识别——全部通过一行 AutoModel API 调用完成。开发者可以在本地、内网或云端独立部署,无需将音频数据发送给第三方 API 服务。
关键量化指标:Fun-ASR-Nano + vLLM 推理可达 340x 实时率(RTF),SenseVoiceSmall 在 CPU 上可达 17x 实时率,CER 低至 7.81%-8.20%,均优于 Whisper-large-v3 的 20% CER 和 13x 实时率。
FunASR 的用户与市场认可
- GitHub 19.3k Stars,178 位贡献者,25 个正式 Release,是 GitHub 上最活跃的开源 ASR 工具包之一。
- PyPI 月下载量持续增长,
funasr包已成为 Python ASR 生态的核心依赖之一。 - 企业采用:被 RAGFlow、Dify、LangChain、AutoGen 等主流 AI 框架集成作为语音输入模块;社区已积累超过 30 个集成项目。
- 行业对标:在中文 ASR 场景下,FunASR 的 CER 和实时率全面领先 Whisper 系列(中文字错率低约 60%,CPU 推理速度高 10-20 倍),且支持 Whisper 不具备的说话人分离、情感检测等能力。
FunASR 的成本优势
| 成本维度 | 说明 |
|---|---|
| 开源免费 | 核心工具包 MIT 协议,无需许可费用,无 API 调用费 |
| 私有化部署 | 可在内网/单机完全离线运行,零数据外泄风险,无按量计费压力 |
| 硬件门槛 | SenseVoiceSmall 在 CPU 即可达到 17x 实时率,无需 GPU;Fun-ASR-Nano 推荐 8GB+ GPU |
| 对比 Whisper API | 云 ASR 服务约 $0.006/分钟;FunASR 自建成本仅硬件折旧与电费,高频场景可节省 90%+ |
对比分析:对于日均处理 1000 小时音频的中高频场景,使用云 ASR 月费约 $10,800+,而 FunASR 自建部署仅需一次性硬件投入(一台带 GPU 的服务器约 $3,000-$8,000),后续边际成本趋近于零。对于隐私敏感场景(医疗、金融、法务),私有化部署的价值无法用价格衡量。
FunASR 的主要功能
- 多模型 ASR 识别:整合 Fun-ASR-Nano(中/英/日+方言)、SenseVoiceSmall(5 语种+情感+事件)、Paraformer(流式/离线)、Qwen3-ASR(52 语种)、Whisper 等,同一 API 切换模型。
- 语音活动检测(VAD):毫秒级 fsmn-vad,自适应静音阈值,长音频自动切分。
- 标点恢复与逆文本正则化:
ct-punc模型自动添加标点,输出可直接阅读的规范文本。 - 说话人分离(Speaker Diarization):CAM++ 模型自动标注"谁在什么时候说了什么",支持多人会议。
- 情感检测与音频事件识别:SenseVoice 内置情感识别(开心/悲伤/愤怒/中性)和事件检测(掌声/笑声/音乐/哭声)。
- OpenAI 兼容 API 服务:一行命令
funasr-server启动 RESTful 服务,SDK 兼容 OpenAI Audio API,直接对接 LangChain/Dify/AutoGen。 - MCP Server for AI Agents:Claude/Cursor 等 Agent 可直接调用本地 ASR 能力。
- 边缘部署(llama.cpp/GGUF):无需 Python 有境,单二进制文件在 CPU/边缘设备运行,支持 Windows CUDA。
FunASR 的模型与版本演进
FunASR 项目始于 2022 年,最初由阿里达摩院发布作为端到端语音识别工具包(INTERSPEECH 2023 论文)。2025-2026 年进入快速迭代期:
| 版本 | 日期 | 核心变化 |
|---|---|---|
| v1.3.19 | 2026-07-19 | WebSocket 长会话排障文档;CLI SRT 分段字幕改进 |
| v1.3.16 | 2026-07-18 | client-driven 实时端点;llama.cpp Windows CUDA 包 |
| v1.3.12 | 2026-06-21 | Qwen3-ASR / GLM-ASR 修复 |
| v1.3.3 | 2026-05-24 | funasr-server CLI、OpenAI API、MCP Server、Dynamic VAD |
| v1.3.0 | 2026-05-20 | Qwen3-ASR (52 语种)、GLM-ASR-Nano (17 语种) 支持 |
| v1.2.x | 2025-2026 | Fun-ASR-Nano、vLLM 推理引擎llama.cpp 边缘运行时 |
| v1.0 | 2024 | 首个稳定版本,Paraformer/SenseVoice 集成 |
| v0.x | 2022-2023 | 初始版本,基础 ASR 与训练框架 |
FunASR 的技术优势
工具包而非单模型:与 Whisper 等单模型方案不同,FunASR 是"模型超市"——每个子任务(VAD、ASR、标点、说话人分离、情感)都有专用模型,可自由组合。例如生产管线 SenseVoice + fsmn-vad + ct-punc + cam++ 一次调用完成全部处理。
推理效率压制:
- Fun-ASR-Nano + vLLM:340x 实时率(比 Whisper-large-v3 快 26 倍),CER 8.20%
- SenseVoiceSmall:CPU 上 17x 实时率(比 Whisper 在 GPU 上还快),CER 7.81%
- 非自回归架构(Paraformer):流式场景下首字延迟极低,支持 WebSocket 实时识别
部署灵活性:覆盖从"pip install"到 Docker/Kubernetes 容器化,再到 llama.cpp 单二进制 CPU/边缘部署的全谱系方案。funasr-server 提供 OpenAI 兼容 API,已有 SDK 的应用只需改 base_url 即可切换。
Agent 原生支持:内置 MCP Server 和 OpenAI API,Claude Desktop、Cursor、LangChain、Dify、AutoGen 等 AI Agent 框架可直接集成语音能力,实现语音驱动的自动化工作流。
FunASR 的使用方式
| 入口 | 说明 |
|---|---|
| Python SDK | pip install funasr,AutoModel 一行调用 |
| CLI | funasr audio.wav 直接转写,支持 JSON/SRT/TSV 输出 |
| API Server | funasr-server --device cuda 启动 OpenAI 兼容端点 |
| Docker | 离线/流式 Docker 镜像,一行启动 |
| llama.cpp | 单二进制 CPU/边缘部署,无需 Python 运行时 |
Python 快速入门:
from funasr import AutoModel
model = AutoModel(model="sensevoice", vad_model="fsmn-vad",
punc_model="ct-punc", spk_model="cam++", device="cuda")
result = model.generate(input="meeting.wav", batch_size_s=300)
for seg in result[0]["sentence_info"]:
print(f"[{seg['start']/1000:.1f}s] Speaker {seg['spk']}: {seg['text']}")
启动 API 服务:
pip install funasr vllm fastapi uvicorn python-multipart
funasr-server --device cuda --port 8899
# 调用
curl -X POST http://localhost:8899/v1/audio/transcriptions \
-F "[email protected]" -F "model=fun-asr-nano" -F "response_format=verbose_json"
MCP 挂载(Claude Desktop):
{
"mcpServers": {
"funasr": {
"command": "funasr-server",
"args": ["--mcp", "--port", "8899"]
}
}
}
FunASR 的产品定价
FunASR 核心工具包采用 MIT 开源协议,完全免费,无隐藏收费、无调用次数限制、无功能阉割。企业可基于源码进行二次开发和商业集成,无需支付授权费用。
模型权重采用独立授权协议,大部分模型(SenseVoice、Paraformer、fsmn-vad、ct-punc、cam++、emotion2vec)可免费商用,具体以各模型卡 License 为准。
隐形成本评估:
- GPU 服务器硬件成本(推荐 8GB+ VRAM 用于 Fun-ASR-Nano;CPU 可用 SenseVoiceSmall)
- 运维成本(Docker/K8s 部署维护)
- 若使用 vLLM 加速,需额外安装 vLLM 依赖
对比商用云 ASR(如阿里云语音识别Azure Speech、Whisper API),日均处理 100 小时音频的场景下,FunASR 自建部署可在 3-6 个月内收回硬件成本。
FunASR 的应用场景
- 会议记录与智能纪要:将企业会议音频自动转为带说话人标签的结构化文本,集成 RAG 知识库实现"语音问答"。相比人工转录,效率提升 10-20 倍。
- 视频字幕与内容生产:支持 SRT/TSV 字幕导出,处理速度 170-340x 实时率。新媒体运营批量处理视频语料时,1 小时视频约 10-20 秒即可完成转写。
- 客服质检与情感分析:SenseVoice 自动检测用户情感状态和关键音频事件(如争吵、投诉升级),辅助质检团队将抽检覆盖率从 5% 提升至 100%。
- AI 语音 Agent/助手:通过 MCP Server 或 OpenAI API 对接 Claude/Cursor/Dify 等 Agent 框架,为 AI 助手提供本地语音输入能力,避免语音数据外传。
- 医疗/金融/法务语音转录:100% 私有化部署,音频数据不出内网,满足 HIPAA/等保等合规要求。
不适配边界:
- 实时通信场景(如电话会议中实时转写),建议使用 Paraformer 流式端点并做好首字延迟调优
- 极小语种(如非洲/美洲土著语言)需自行训练或使用 Qwen3-ASR,覆盖率可能不完整
- 对识别延迟要求极高(<50ms)的交互式场景,需结合 streaming VAD 和 Paraformer 定制优化
FunASR 的适用人群
- AI 应用开发者:需要为产品集成语音能力,FunASR 提供 Python SDK 和 OpenAI 兼容 API,集成本极低。可替代云 ASR 服务,节省长期 API 费用。
- 企业 AI 团队:对数据隐私和合规有严格要求的行业(医疗、金融、法律),FunASR 的私有化部署能力是刚需。建议优先评估模型选择与硬件规划。
- 语音产品集成商:需要定制 ASR 管线的 ISV/SI,FunASR 的模块化架构允许替换任意组件,支持 fine-tune。
- 个人开发者和研究者:MIT 协议允许自由使用和二次开发,学术研究无限制。Colab 快速入门可在 5 分钟内跑通第一个识别任务。
- 不适合场景:零代码/非技术用户直接使用,目前主要通过 Python/CLI/API 交互,无图形界面;需要端到端 SaaS 开箱即用的场景,建议搭配第三方 UI 封装。
FunASR 的总结与展望
FunASR 是目前开源社区功能最完整、性能最领先的工业级语音识别工具包。其核心竞争力在于"多模型组合 + 极致推理效率 + 全谱系部署方案"三位一体:开发者可以根据场景自由组合 ASR/VAD/标点/说话人分离模型,通过 vLLM 达到 340x 实时率,并以 Python SDK / OpenAI API / MCP / llama.cpp 等任意方式部署。
当前局限:
- 文档和教程仍以英文和中文为主,日文/韩文文档在建设中
- 部分模型(Fun-ASR-Nano)推荐 GPU 运行,CPU 可用但需选用 SenseVoiceSmall
- 实时 WebSocket 服务在高并发场景下仍需针对具体硬件调优参数
采购/采用风险评估:FunASR 开源免费且 MIT 协议,采用风险极低。企业部署前建议在代表性音频数据上做 CER 和 RTF 基准测试,选择最适配的模型组合(推荐从 SenseVoiceSmall 开始验证)。长期依赖风险主要来自社区维护持续性,但阿里通义实验室和 ModelScope 的持续投入(2025-2026 年月均 2-3 个版本更新)提供了良好保障。对于需要商业支持的企业,可以考虑阿里云语音识别产品作为备选方案。总结:作为底层 ASR 引擎,FunASR 在技术指标和合规自由度上均优于闭源云 API 和 Whisper 自建方案,是"语音转文本"基础设施层的首选开源工具包。
限制与不适配场景
该工具在以下场景中存在使用限制:
场景适配边界 需要高度行业专业知识的任务、对输出格式有严格规范的场景、需要零错误的自动化流程可能效果不达预期。AI 输出应作为初稿或辅助参考,最终结果需人工核验。
技术限制 上下文长度有限、复杂推理准确性可能不足、免费版有使用额度。建议在正式采用前通过试用验证核心场景的可用性。
版本信息
- v1.3.19 :新增实时 WebSocket 长会话排障文档;CLI SRT/TSV 字幕输出改进;client-driven 实时端点支持 Fun-ASR-Nano。
- v1.3.18 :CLI SRT/TSV 字幕输出使用句子时间戳,写入分段字幕提示。
- v1.3.16 :新增 client-driven 实时 WebSocket 端点,无需服务端 VAD 即可流式识别。
- v1.3.12 :Qwen3-ASR 语言代码修复GLM-ASR 修复vLLM repetition_penalty 修复。
- v1.3.3 :新增 funasr-server CLI、OpenAI 兼容 API、MCP Server for AI Agents、Dynamic VAD。
用户评价