FunASR 免费

-

FunASR 是阿里通义实验室(Tongyi Lab)开源的工业级语音识别工具包,集 ASR、VAD、标点恢复、说话人分离、情感检测与音频事件识别于一体,提供统一的 Python 接口与 OpenAI 兼容 API,支持 50+ 语言340x 实时率推理,可完全私有化部署。

FunASR 产品界面

FunASR:阿里通义实验室开源的工业级语音识别工具包

FunASR 的核心参数与统计

项目 详细信息
产品名称 FunASR (Fun Audio Speech Recognition)
产品类型 开源语音识别工具包
交付形式 Python SDK / CLI / OpenAI 兼容 API Server / Docker / llama.cpp 边缘部署
支持语言 50+ 语言(Fun-ASR-Nano 支持中/英/日及中文方言;MLT-Nano 支持 31 语种;Qwen3-ASR 支持 52 语种)
模型规模 0.4M(fsmn-vad)~ 1.7B(Qwen3-ASR)
GitHub Stars 19.3k
开源协议 MIT(工具包);模型权重按各自协议授权
目标用户 开发者、企业AI团队、语音产品集成商

FunASR 并非一个单一的 SaaS 产品,而是一套完整的开源语音理解工具链。它提供从原始音频到结构化文本的"端到端流水线"——VAD 切分ASR 识别、标点恢复、说话人分离、情感检测、音频事件识别——全部通过一行 AutoModel API 调用完成。开发者可以在本地、内网或云端独立部署,无需将音频数据发送给第三方 API 服务。

关键量化指标:Fun-ASR-Nano + vLLM 推理可达 340x 实时率(RTF),SenseVoiceSmall 在 CPU 上可达 17x 实时率,CER 低至 7.81%-8.20%,均优于 Whisper-large-v3 的 20% CER 和 13x 实时率。

FunASR 的用户与市场认可

  • GitHub 19.3k Stars,178 位贡献者,25 个正式 Release,是 GitHub 上最活跃的开源 ASR 工具包之一。
  • PyPI 月下载量持续增长,funasr 包已成为 Python ASR 生态的核心依赖之一。
  • 企业采用:被 RAGFlow、Dify、LangChain、AutoGen 等主流 AI 框架集成作为语音输入模块;社区已积累超过 30 个集成项目。
  • 行业对标:在中文 ASR 场景下,FunASR 的 CER 和实时率全面领先 Whisper 系列(中文字错率低约 60%,CPU 推理速度高 10-20 倍),且支持 Whisper 不具备的说话人分离、情感检测等能力。

FunASR 的成本优势

成本维度 说明
开源免费 核心工具包 MIT 协议,无需许可费用,无 API 调用费
私有化部署 可在内网/单机完全离线运行,零数据外泄风险,无按量计费压力
硬件门槛 SenseVoiceSmall 在 CPU 即可达到 17x 实时率,无需 GPU;Fun-ASR-Nano 推荐 8GB+ GPU
对比 Whisper API 云 ASR 服务约 $0.006/分钟;FunASR 自建成本仅硬件折旧与电费,高频场景可节省 90%+

对比分析:对于日均处理 1000 小时音频的中高频场景,使用云 ASR 月费约 $10,800+,而 FunASR 自建部署仅需一次性硬件投入(一台带 GPU 的服务器约 $3,000-$8,000),后续边际成本趋近于零。对于隐私敏感场景(医疗、金融、法务),私有化部署的价值无法用价格衡量。

FunASR 的主要功能

  • 多模型 ASR 识别:整合 Fun-ASR-Nano(中/英/日+方言)、SenseVoiceSmall(5 语种+情感+事件)、Paraformer(流式/离线)、Qwen3-ASR(52 语种)、Whisper 等,同一 API 切换模型。
  • 语音活动检测(VAD):毫秒级 fsmn-vad,自适应静音阈值,长音频自动切分。
  • 标点恢复与逆文本正则化ct-punc 模型自动添加标点,输出可直接阅读的规范文本。
  • 说话人分离(Speaker Diarization):CAM++ 模型自动标注"谁在什么时候说了什么",支持多人会议。
  • 情感检测与音频事件识别:SenseVoice 内置情感识别(开心/悲伤/愤怒/中性)和事件检测(掌声/笑声/音乐/哭声)。
  • OpenAI 兼容 API 服务:一行命令 funasr-server 启动 RESTful 服务,SDK 兼容 OpenAI Audio API,直接对接 LangChain/Dify/AutoGen。
  • MCP Server for AI Agents:Claude/Cursor 等 Agent 可直接调用本地 ASR 能力。
  • 边缘部署(llama.cpp/GGUF):无需 Python 有境,单二进制文件在 CPU/边缘设备运行,支持 Windows CUDA。

FunASR 的模型与版本演进

FunASR 项目始于 2022 年,最初由阿里达摩院发布作为端到端语音识别工具包(INTERSPEECH 2023 论文)。2025-2026 年进入快速迭代期:

版本 日期 核心变化
v1.3.19 2026-07-19 WebSocket 长会话排障文档;CLI SRT 分段字幕改进
v1.3.16 2026-07-18 client-driven 实时端点;llama.cpp Windows CUDA 包
v1.3.12 2026-06-21 Qwen3-ASR / GLM-ASR 修复
v1.3.3 2026-05-24 funasr-server CLI、OpenAI API、MCP Server、Dynamic VAD
v1.3.0 2026-05-20 Qwen3-ASR (52 语种)、GLM-ASR-Nano (17 语种) 支持
v1.2.x 2025-2026 Fun-ASR-Nano、vLLM 推理引擎llama.cpp 边缘运行时
v1.0 2024 首个稳定版本,Paraformer/SenseVoice 集成
v0.x 2022-2023 初始版本,基础 ASR 与训练框架

FunASR 的技术优势

工具包而非单模型:与 Whisper 等单模型方案不同,FunASR 是"模型超市"——每个子任务(VAD、ASR、标点、说话人分离、情感)都有专用模型,可自由组合。例如生产管线 SenseVoice + fsmn-vad + ct-punc + cam++ 一次调用完成全部处理。

推理效率压制

  • Fun-ASR-Nano + vLLM:340x 实时率(比 Whisper-large-v3 快 26 倍),CER 8.20%
  • SenseVoiceSmall:CPU 上 17x 实时率(比 Whisper 在 GPU 上还快),CER 7.81%
  • 非自回归架构(Paraformer):流式场景下首字延迟极低,支持 WebSocket 实时识别

部署灵活性:覆盖从"pip install"到 Docker/Kubernetes 容器化,再到 llama.cpp 单二进制 CPU/边缘部署的全谱系方案。funasr-server 提供 OpenAI 兼容 API,已有 SDK 的应用只需改 base_url 即可切换。

Agent 原生支持:内置 MCP Server 和 OpenAI API,Claude Desktop、Cursor、LangChain、Dify、AutoGen 等 AI Agent 框架可直接集成语音能力,实现语音驱动的自动化工作流。

FunASR 的使用方式

入口 说明
Python SDK pip install funasrAutoModel 一行调用
CLI funasr audio.wav 直接转写,支持 JSON/SRT/TSV 输出
API Server funasr-server --device cuda 启动 OpenAI 兼容端点
Docker 离线/流式 Docker 镜像,一行启动
llama.cpp 单二进制 CPU/边缘部署,无需 Python 运行时

Python 快速入门

from funasr import AutoModel

model = AutoModel(model="sensevoice", vad_model="fsmn-vad", 
                  punc_model="ct-punc", spk_model="cam++", device="cuda")
result = model.generate(input="meeting.wav", batch_size_s=300)
for seg in result[0]["sentence_info"]:
    print(f"[{seg['start']/1000:.1f}s] Speaker {seg['spk']}: {seg['text']}")

启动 API 服务

pip install funasr vllm fastapi uvicorn python-multipart
funasr-server --device cuda --port 8899
# 调用
curl -X POST http://localhost:8899/v1/audio/transcriptions \
  -F "[email protected]" -F "model=fun-asr-nano" -F "response_format=verbose_json"

MCP 挂载(Claude Desktop)

{
  "mcpServers": {
    "funasr": {
      "command": "funasr-server",
      "args": ["--mcp", "--port", "8899"]
    }
  }
}

FunASR 的产品定价

FunASR 核心工具包采用 MIT 开源协议,完全免费,无隐藏收费、无调用次数限制、无功能阉割。企业可基于源码进行二次开发和商业集成,无需支付授权费用。

模型权重采用独立授权协议,大部分模型(SenseVoice、Paraformer、fsmn-vad、ct-punc、cam++、emotion2vec)可免费商用,具体以各模型卡 License 为准。

隐形成本评估

  • GPU 服务器硬件成本(推荐 8GB+ VRAM 用于 Fun-ASR-Nano;CPU 可用 SenseVoiceSmall)
  • 运维成本(Docker/K8s 部署维护)
  • 若使用 vLLM 加速,需额外安装 vLLM 依赖

对比商用云 ASR(如阿里云语音识别Azure Speech、Whisper API),日均处理 100 小时音频的场景下,FunASR 自建部署可在 3-6 个月内收回硬件成本。

FunASR 的应用场景

  • 会议记录与智能纪要:将企业会议音频自动转为带说话人标签的结构化文本,集成 RAG 知识库实现"语音问答"。相比人工转录,效率提升 10-20 倍。
  • 视频字幕与内容生产:支持 SRT/TSV 字幕导出,处理速度 170-340x 实时率。新媒体运营批量处理视频语料时,1 小时视频约 10-20 秒即可完成转写。
  • 客服质检与情感分析:SenseVoice 自动检测用户情感状态和关键音频事件(如争吵、投诉升级),辅助质检团队将抽检覆盖率从 5% 提升至 100%。
  • AI 语音 Agent/助手:通过 MCP Server 或 OpenAI API 对接 Claude/Cursor/Dify 等 Agent 框架,为 AI 助手提供本地语音输入能力,避免语音数据外传。
  • 医疗/金融/法务语音转录:100% 私有化部署,音频数据不出内网,满足 HIPAA/等保等合规要求。

不适配边界

  • 实时通信场景(如电话会议中实时转写),建议使用 Paraformer 流式端点并做好首字延迟调优
  • 极小语种(如非洲/美洲土著语言)需自行训练或使用 Qwen3-ASR,覆盖率可能不完整
  • 对识别延迟要求极高(<50ms)的交互式场景,需结合 streaming VAD 和 Paraformer 定制优化

FunASR 的适用人群

  • AI 应用开发者:需要为产品集成语音能力,FunASR 提供 Python SDK 和 OpenAI 兼容 API,集成本极低。可替代云 ASR 服务,节省长期 API 费用。
  • 企业 AI 团队:对数据隐私和合规有严格要求的行业(医疗、金融、法律),FunASR 的私有化部署能力是刚需。建议优先评估模型选择与硬件规划。
  • 语音产品集成商:需要定制 ASR 管线的 ISV/SI,FunASR 的模块化架构允许替换任意组件,支持 fine-tune。
  • 个人开发者和研究者:MIT 协议允许自由使用和二次开发,学术研究无限制。Colab 快速入门可在 5 分钟内跑通第一个识别任务。
  • 不适合场景:零代码/非技术用户直接使用,目前主要通过 Python/CLI/API 交互,无图形界面;需要端到端 SaaS 开箱即用的场景,建议搭配第三方 UI 封装。

FunASR 的总结与展望

FunASR 是目前开源社区功能最完整、性能最领先的工业级语音识别工具包。其核心竞争力在于"多模型组合 + 极致推理效率 + 全谱系部署方案"三位一体:开发者可以根据场景自由组合 ASR/VAD/标点/说话人分离模型,通过 vLLM 达到 340x 实时率,并以 Python SDK / OpenAI API / MCP / llama.cpp 等任意方式部署。

当前局限

  • 文档和教程仍以英文和中文为主,日文/韩文文档在建设中
  • 部分模型(Fun-ASR-Nano)推荐 GPU 运行,CPU 可用但需选用 SenseVoiceSmall
  • 实时 WebSocket 服务在高并发场景下仍需针对具体硬件调优参数

采购/采用风险评估:FunASR 开源免费且 MIT 协议,采用风险极低。企业部署前建议在代表性音频数据上做 CER 和 RTF 基准测试,选择最适配的模型组合(推荐从 SenseVoiceSmall 开始验证)。长期依赖风险主要来自社区维护持续性,但阿里通义实验室和 ModelScope 的持续投入(2025-2026 年月均 2-3 个版本更新)提供了良好保障。对于需要商业支持的企业,可以考虑阿里云语音识别产品作为备选方案。总结:作为底层 ASR 引擎,FunASR 在技术指标和合规自由度上均优于闭源云 API 和 Whisper 自建方案,是"语音转文本"基础设施层的首选开源工具包。

限制与不适配场景

该工具在以下场景中存在使用限制:

场景适配边界 需要高度行业专业知识的任务、对输出格式有严格规范的场景、需要零错误的自动化流程可能效果不达预期。AI 输出应作为初稿或辅助参考,最终结果需人工核验。

技术限制 上下文长度有限、复杂推理准确性可能不足、免费版有使用额度。建议在正式采用前通过试用验证核心场景的可用性。

版本信息

  • v1.3.19 :新增实时 WebSocket 长会话排障文档;CLI SRT/TSV 字幕输出改进;client-driven 实时端点支持 Fun-ASR-Nano。
  • v1.3.18 :CLI SRT/TSV 字幕输出使用句子时间戳,写入分段字幕提示。
  • v1.3.16 :新增 client-driven 实时 WebSocket 端点,无需服务端 VAD 即可流式识别。
  • v1.3.12 :Qwen3-ASR 语言代码修复GLM-ASR 修复vLLM repetition_penalty 修复。
  • v1.3.3 :新增 funasr-server CLI、OpenAI 兼容 API、MCP Server for AI Agents、Dynamic VAD。

用户评价

  • 加载评价中...