楽しいASR 無料

-

FunASR は、Alibaba Tongyi Lab が提供するオープンソースの産業グレードの音声認識ツールキットです。 ASR、VAD、句読点回復、話者分離、感情検出、音声イベント認識が統合されています。統合された Python インターフェイスと OpenAI 互換 API を提供し、50 以上の言語で 340 倍のリアルタイム レート推論をサポートし、展開のために完全に民営化できます。

楽しいASR 製品インターフェース

FunASR: Alibaba Tongyi Lab のオープンソースの産業グレードの音声認識ツールキット

FunASR のコアパラメータと統計

プロジェクト 詳細
製品名 FunASR (楽しいオーディオ音声認識)
製品タイプ オープンソースの音声認識ツールキット
納品フォーム Python SDK / CLI / OpenAI 互換 API サーバー / Docker / llama.cpp エッジ展開
サポートされている言語 50 以上の言語 (Fun-ASR-Nano は中国語/英語/日本語および中国語の方言をサポートします。MLT-Nano は 31 言語をサポートします。Qwen3-ASR は 52 言語をサポートします)
モデルサイズ 0.4M (fsmn-vad) ~ 1.7B (Qwen3-ASR)
GitHub スター 19.3k
オープンソース契約 MIT (ツールキット);モデルの重量は、それぞれの契約に従ってライセンスされています。
対象ユーザー 開発者、エンタープライズ AI チーム、音声製品インテグレーター

FunASR は単一の SaaS 製品ではなく、完全なオープンソースの音声理解ツール チェーンです。これは、生の音声から構造化テキストに至る「エンドツーエンドのパイプライン」 (VAD セグメンテーション ASR 認識、句読点の回復、話者の分離、感情検出、音声イベント認識) をすべて 1 行の「AutoModel」 API 呼び出しを通じて提供します。開発者は、サードパーティの API サービスに音声データを送信せずに、ローカル、イントラネット、またはクラウドに独立して展開できます。

主要な定量的指標: Fun-ASR-Nano + vLLM 推論は 340 倍のリアルタイム レート (RTF) に達し、SenseVoiceSmall は CPU 上で 17 倍のリアルタイム レートに達し、CER は 7.81% ~ 8.20% と低く、どちらも Whisper-large-v3 の 20% CER および 13 倍のリアルタイム レートより優れています。

FunASR のユーザーと市場の認知度

  • GitHub 19.3k Stars、178 人の寄稿者、25 の公式リリースは、GitHub 上で最も活発なオープンソース ASR ツールキットの 1 つです。
  • PyPI の月間ダウンロード数は増加し続けており、funasr パッケージは Python ASR エコシステムの中核的な依存関係の 1 つになりました。
  • エンタープライズ導入: RAGFlow、Dify、LangChain、AutoGen などの主流の AI フレームワークによって音声入力モジュールとして統合されています。コミュニティには 30 以上の統合プロジェクトが蓄積されています。
  • 業界ベンチマーク: 中国語 ASR シナリオでは、FunASR の CER とリアルタイム レートは Whisper シリーズよりも総合的に優れており (中国語単語エラー率は約 60% 低く、CPU 推論速度は 10 ~ 20 倍高速です)、話者分離、感情検出、および Whisper にはないその他の機能をサポートしています。

FunASR のコスト上の利点

コスト ディメンション 説明
オープンソースで無料 コア ツールキット MIT ライセンス、ライセンス料なし、API 呼び出し料なし
プライベート展開 イントラネット/単一マシン上で完全にオフラインで実行でき、データ漏洩のリスクがなく、従量課金制のプレッシャーもありません。
ハードウェアしきい値 SenseVoiceSmall は、GPU を使用せずに CPU 上で 17 倍のリアルタイム レートを達成できます。 Fun-ASR-Nano は 8GB 以上の GPU を推奨します
Whisper API の比較 クラウド ASR サービスは、1 分あたり約 0.006 ドルです。 FunASR の自己構築コストはハードウェアの減価償却費と電力のみであり、高頻度のシナリオでは 90% 以上を節約できます。

比較分析: 1 日あたり 1,000 時間のオーディオを処理する中高周波のシナリオの場合、クラウド ASR の月額使用料は約 10,800 ドル以上ですが、FunASR の自己構築展開に必要なハードウェア投資は 1 回だけであり (GPU を備えたサーバーの費用は約 3,000 ドルから 8,000 ドル)、その後の限界費用はゼロに近くなります。プライバシーに配慮したシナリオ (医療、金融、法律) の場合、民営化された展開の価値は価格では測れません。

FunASRの主な機能

  • マルチモデル ASR 認識: Fun-ASR-Nano (中国語/英語/日本語 + 方言)、SenseVoiceSmall (5 言語 + 感情 + イベント)、Paraformer (ストリーミング/オフライン)、Qwen3-ASR (52 言語)、Whisper などを統合し、同じ API でモデルを切り替えます。
  • 音声アクティビティ検出 (VAD): ミリ秒レベルの fsmn-vad、適応型沈黙しきい値、長い音声の自動セグメンテーション。
  • 句読点の回復と逆テキスト正則化: ct-punc モデルは自動的に句読点を追加し、直接読み取ることができる正規テキストを出力します。
  • 発言者ダイアライゼーション: CAM++ モデルは、「誰がいつ何を言ったか」に自動的に注釈を付け、複数人での会議をサポートします。
  • 感情検出と音声イベント認識: SenseVoice には、感情認識 (幸せ/悲しみ/怒り/中立) とイベント検出 (拍手/笑い/音楽/泣き) が組み込まれています。
  • OpenAI 互換 API サービス: 1 行のコマンド funasr-server で RESTful サービスを開始します。この SDK は OpenAI Audio API と互換性があり、LangChain/Dify/AutoGen に直接接続します。
  • AI エージェント用 MCP サーバー: クロード/カーソルなどのエージェントは、ローカル ASR 機能を直接呼び出すことができます。
  • エッジ展開 (llama.cpp/GGUF): Python コンテキストは必要ありません。単一のバイナリが CPU/エッジ デバイス上で実行され、Windows CUDA をサポートします。

FunASR モデルとバージョンの進化

FunASR プロジェクトは 2022 年に開始され、当初はエンドツーエンドの音声認識ツールキットとして Alibaba Damo Academy によってリリースされました (INTERSPEECH 2023 論文)。 2025 年から 2026 年は急速な反復期間に入ります。

バージョン 日付 主要な変更点
v1.3.19 2026-07-19 WebSocket の長時間セッションのトラブルシューティングに関するドキュメント。 CLI SRT セグメント化された字幕の改善
v1.3.16 2026-07-18 クライアント主導のリアルタイム エンドポイント。 llama.cpp Windows CUDA パッケージ
v1.3.12 2026-06-21 Qwen3-ASR / GLM-ASR 修正
v1.3.3 2026-05-24 funasr-server CLI、OpenAI API、MCP サーバー、ダイナミック VAD
v1.3.0 2026-05-20 Qwen3-ASR (52 言語)、GLM-ASR-Nano (17 言語) をサポート
v1.2.x 2025 ~ 2026 年 Fun-ASR-Nano、vLLM 推論エンジン llama.cpp エッジ ランタイム
v1.0 2024年 最初の安定バージョン、Paraformer/SenseVoice 統合
v0.x 2022 ~ 2023 年 初期バージョン、基本的な ASR およびトレーニング フレームワーク

FunASR の技術的利点

単一モデルの代わりのツールキット: Whisper などの単一モデル ソリューションとは異なり、FunASR は「モデル スーパーマーケット」です。サブタスク (VAD、ASR、句読点、話者分離、感情) ごとに専用のモデルがあり、自由に組み合わせることができます。たとえば、本番パイプライン「SenseVoice + fsmn-vad + ct-punc + cam++」は、1 回の呼び出しですべての処理を完了します。

推論効率の抑制:

  • Fun-ASR-Nano + vLLM: 340 倍のリアルタイム レート (Whisper-large-v3 より 26 倍高速)、CER 8.20%
  • SenseVoiceSmall: CPU 上で 17 倍のリアルタイム (GPU 上の Whisper より高速)、CER 7.81%
  • 非自己回帰アーキテクチャ (パラフォーマー): ストリーミング シナリオでの最初の単語遅延が非常に低く、WebSocket リアルタイム認識をサポートします。

導入の柔軟性: 「pip install」から Docker/Kubernetes コンテナ化、llama.cpp のシングル バイナリ CPU/エッジ導入まで、あらゆる領域をカバーします。 「funasr-server」はOpenAI互換のAPIを提供します。既存の SDK を使用するアプリケーションは、base_url を変更するだけで切り替えることができます。

エージェント ネイティブ サポート: 組み込みの MCP サーバーと OpenAI API、Claude Desktop、Cursor、LangChain、Dify、AutoGen などの AI エージェント フレームワークは、音声機能を直接統合して、音声主導の自動ワークフローを実現できます。

FunASR の使用方法

入口 説明
Python SDK pip install funasrAutoModel を 1 行で呼び出します。
CLI funasr audio.wav 直接転写、JSON/SRT/TSV 出力をサポート
APIサーバー funasr-server --device cuda は OpenAI 互換エンドポイントを開始します。
ドッカー オフライン/ストリーミング Docker イメージ、1 行で起動
ラマ.cpp 単一のバイナリ CPU/エッジ展開、Python ランタイムは不要

Python クイック スタート: 「」パイソン funasr から AutoModel をインポート

モデル = AutoModel(model="sensevoice", vad_model="fsmn-vad", punc_model="ct-punc"、spk_model="cam++"、device="cuda") result = model.generate(input="meeting.wav"、batch_size_s=300) result[0]["sentence_info"] のセグメント: print(f"[{seg['start']/1000:.1f}s] スピーカー {seg['spk']}: {seg['text']}") 「」

API サービスを開始します: 「」バッシュ pip install funasr vllm fastapi uvicorn python-multipart funasr-server --device cuda --port 8899

呼び出し

curl -X POST http://localhost:8899/v1/audio/transcriptions \ -F "[email protected]" -F "model=fun-asr-nano" -F "response_format=verbose_json" 「」

MCP マウント (クロード デスクトップ):


{
  "mcpサーバー": {
    "ふなっしー": {
      "コマンド": "funasr-サーバー",
      "args": ["--mcp"、"--port"、"8899"]
    }
  }
}
「」

## FunASR の製品価格

FunASR コア ツールキットは **MIT オープン ソース ライセンス**を採用しており、完全に無料で、隠れた料金、呼び出し回数の制限、機能の去勢はありません。企業は、ライセンス料を支払うことなく、ソースコードに基づいて二次開発や商用統合を実行できます。

モデルの重みは独立したライセンス契約を採用しています。ほとんどのモデル (SenseVoice、Paraformer、fsmn-vad、ct-punc、cam++、emotion2vec) は無料で商用利用できます。詳細は各モデルカードのライセンスに準じます。

**隠れたコストの評価**:
- GPU サーバー ハードウェアのコスト (Fun-ASR-Nano には 8GB 以上の VRAM を推奨、CPU には SenseVoiceSmall が利用可能)
- 運用保守コスト (Docker/K8s の導入と保守)
- vLLM アクセラレーションを使用する場合は、追加の vLLM 依存関係をインストールする必要があります

商用クラウド ASR (Alibaba Cloud 音声認識 Azure Speech、Whisper API など) と比較して、1 日あたり平均 100 時間の音声を処理するシナリオでは、FunASR の自社構築デプロイメントは 3 ~ 6 か月以内にハードウェア コストを回収できます。

## FunASR の応用シナリオ

- **会議記録とインテリジェントな議事録**: 企業会議の音声を発言者タグ付きの構造化テキストに自動的に変換し、RAG ナレッジ ベースを統合して「音声質疑応答」を実装します。手動転写と比較して、効率は10〜20倍向上します。
- **ビデオ字幕とコンテンツ制作**: SRT/TSV 字幕エクスポート、処理速度 170 ~ 340 倍のリアルタイム レートをサポートします。新しいメディア操作でビデオ コーパスをバッチ処理する場合、1 時間のビデオの文字起こしは約 10 ~ 20 秒で完了します。
- **顧客サービスの品質検査と感情分析**: SenseVoice は、ユーザーの感情状態と主要な音声イベント (口論、苦情のエスカレーションなど) を自動的に検出し、品質検査チームがランダム検査のカバー率を 5% から 100% に高めるのを支援します。
- **AI 音声エージェント/アシスタント**: MCP サーバーまたは OpenAI API を介して Claude/Cursor/Dify などのエージェント フレームワークに接続し、AI アシスタントにローカル音声入力機能を提供し、音声データの外部送信を回避します。
- **医療/金融/法律音声トランスクリプション**: 100% 民営化された展開で、音声データはイントラネットから流出せず、HIPAA/MLI コンプライアンス要件を満たしています。

**境界に適合していません**:
- リアルタイム通信シナリオ (電話会議でのリアルタイム文字起こしなど) の場合は、Paraformer ストリーミング エンドポイントを使用し、最初の単語の遅延を最適化することをお勧めします。
- 非常に小規模な言語 (アフリカ/ネイティブ アメリカンの言語など) は、独自にトレーニングするか、Qwen3-ASR を使用する必要があり、カバレッジが不完全である可能性があります。
- 非常に高い認識遅延 (<50ms) を必要とするインタラクティブ シーンでは、ストリーミング VAD と Paraformer のカスタム最適化が必要です。

## FunASR の該当グループ

- **AI アプリケーション開発者**: 音声機能を製品に統合する必要があります。 FunASR は、非常に低い統合コストで、Python SDK と OpenAI 互換の API を提供します。クラウド ASR サービスを置き換え、長期的な API 料金を節約します。
- **エンタープライズ AI チーム**: データ プライバシーとコンプライアンスに対する厳しい要件がある業界 (医療、金融、法務) では、FunASR の民営化された展開機能が緊急に必要とされています。モデルの選択とハードウェアの計画の評価を優先することをお勧めします。
- **音声製品インテグレーター**: ASR パイプラインをカスタマイズする必要がある ISV/SI。 FunASR のモジュラー アーキテクチャにより、あらゆるコンポーネントの交換が可能になり、微調整がサポートされます。
- **個人の開発者および研究者**: MIT ライセンスでは、学術研究に対する制限なく、自由な使用と二次開発が許可されています。 Colab クイック スタートを使用すると、最初の識別タスクを 5 分で完了できます。
- **シナリオには適していません**: ゼロコード/技術者以外のユーザーによる直接使用。現在は主に Python/CLI/API を介して操作され、グラフィカル インターフェイスはありません。エンドツーエンドの SaaS をそのまま使用する必要があるシナリオでは、サードパーティの UI パッケージを使用することをお勧めします。

## FunASR の概要と展望

FunASR は現在、オープンソース コミュニティで最も完全かつ最先端の産業グレードの音声認識ツールキットです。その核となる競争力は、「マルチモデルの組み合わせ + 究極の推論効率 + フルスペクトル展開ソリューション」の三位一体にあります。開発者は、シナリオに応じて ASR/VAD/句読点/話者分離モデルを自由に組み合わせ、vLLM を通じて 340 倍のリアルタイム レートを達成し、Python SDK / OpenAI API / MCP / llama.cpp などの任意の方法で展開できます。

**現在の制限事項**:
- ドキュメントとチュートリアルは依然として主に英語と中国語であり、日本語/韓国語のドキュメントは準備中です。
- 一部のモデル (Fun-ASR-Nano) は GPU での実行が推奨されており、CPU は利用可能ですが、SenseVoiceSmall を選択する必要があります
- リアルタイム WebSocket サービスは、同時実行性の高いシナリオで特定のハードウェアに合わせてパラメーターを調整する必要があります。

**取得/導入リスク評価**: FunASR はオープンソースで無料であり、MIT ライセンスを取得しているため、導入リスクは非常に低くなります。企業で導入する前に、代表的な音声データに対して CER および RTF ベンチマーク テストを実施し、最適なモデルの組み合わせを選択することをお勧めします (検証のために SenseVoiceSmall から始めることをお勧めします)。長期依存のリスクは主にコミュニティのメンテナンスの継続によってもたらされますが、Alibaba Tongyi Lab と ModelScope への継続的な投資 (2025 ~ 2026 年に月平均 2 ~ 3 回のバージョン更新) により、十分な保護が提供されます。商用サポートが必要な企業の場合は、Alibaba Cloud 音声認識製品を代替手段として検討できます。 **概要: FunASR は、基盤となる ASR エンジンとして、技術指標とコンプライアンスの自由度の点で、クローズドソースのクラウド API や Whisper の自社構築ソリューションよりも優れており、「音声テキスト変換」インフラストラクチャ層に推奨されるオープンソース ツールキットです。 **

関連ツール: <a href="https://www.aistarmap.com/ja-JP/aitool/elevenlabs" target="_self" class="tool-link"><img src="https://res.aistarmap.com/uploads/images/tools/zh-CN/elevenlabs/logo_1785767412.svg" alt="イレブンラボ" class="tool-logo" style="width: 20px; height: 20px; margin-right: 5px; vertical-align: middle;">イレブンラボ</a>、udio

バージョン情報

  • v1.3.19 :リアルタイム WebSocket の長時間セッションのトラブルシューティングに関するドキュメントを追加しました。 CLI SRT/TSV 字幕出力の改善。クライアント主導のリアルタイム エンドポイントは Fun-ASR-Nano をサポートします。
  • v1.3.18 :CLI SRT/TSV 字幕出力は、文のタイムスタンプを使用してセグメント化された字幕プロンプトを書き込みます。
  • v1.3.16 :サーバー側 VAD を使用せずにストリーミング認識を行うための、クライアント主導のリアルタイム WebSocket エンドポイントを追加しました。
  • v1.3.12 :Qwen3-ASR 言語コードの修正 GLM-ASR の修正 vLLM repetition_penalty の修正。
  • v1.3.3 :funasr-server CLI、OpenAI 互換 API、AI エージェント用の MCP サーバー、および動的 VAD を追加しました。

ユーザーレビュー

  • レビューを読み込み中...