ファン-ASR1.5
無料
Fun-ASR1.5 は、Alibaba Tongyi チームによって開始された大規模なエンドツーエンドの音声認識モデルです。 MoE アーキテクチャに基づいた単一モデルは、30 の言語、7 つの主要な方言体系、および 20 以上の地方アクセントをサポートし、インテリジェントな句読点予測およびテキスト正規化機能が組み込まれています。
Fun-ASR1.5: Alibaba Tongyi エンドツーエンド音声認識モデル
Fun-ASR1.5 のコアパラメータと統計
| プロジェクト | 詳細 |
|---|---|
| 製品名 | Fun-ASR1.5 (Alibaba Tongyi 音声認識モデル) |
| 製品タイプ | エンドツーエンドの音声認識大規模モデル |
| 納品フォーム | Python ライブラリ/API/CLI/MCP サーバー |
| サポートされている言語 | 30言語(中国語、英語、日本語、韓国語、フランス語、ドイツ語、スペイン語、ポルトガル語、ロシア語、アラビア語など) |
| 方言取材 | 上海語、広東語、四川語など、需要の高い 15 の方言の最適化に重点を置いた 7 つの主要な方言システム |
| 建築 | MoE (混合エキスパート アーキテクチャ) |
| 最新バージョン | FunASR 1.3.19 (2026-07-19) |
| オープンソース契約 | MIT (ツールキット) / モデルの重みには別の契約が付属します |
| GitHub スター | 19.3k |
| 対象ユーザー | 開発者、企業、研究機関 |
パラメータの解釈: 30 の言語をカバーする単一のモデルは、展開中に言語ごとに個別のモデル インスタンスを維持する必要がないことを意味します。 MoE アーキテクチャにより、対応するエキスパート モジュールは特定の言語が認識された場合にのみアクティブ化され、推論効率は同じスケールの高密度モデルよりも高くなります。方言エラー率 (CER) は以前のバージョンと比較して 56.2% 低下し、実際のシナリオでは手動校正コストを大幅に削減できます。
Fun-ASR1.5 のユーザーと市場の認知度
Fun-ASR1.5 の背後には、Alibaba Damo Academy のオープンソース FunASR プロジェクト (GitHub 19.3k Stars) があります。これは現在、中国語の音声認識コミュニティで最も活発なエンドツーエンド ツールキットの 1 つです。 PyPI の累積ダウンロード数は多数の個人開発者と企業ユーザーをカバーしており、178 人を超えるコミュニティ貢献者がいます。
ベンチマーク テストでは、Fun-ASR-Nano (Fun-ASR1.5 シリーズの主力モデル) は、中国語の長い音声テスト セットで単語誤り率 (CER) がわずか 8.20% に達しました。これは、Whisper-large-v3-turbo の 21.71% よりもはるかに低いです。推論速度はリアルタイム 340 倍 (vLLM 使用時) に達し、Whisper の 26 倍以上に達しました。 SenseVoiceSmall モデルは、CPU 上で 17 倍のリアルタイム推論を実現でき、GPU を必要とせずに実稼働レベルのスループットを満たすことができます。
このプロジェクトは、会議議事録、インテリジェントな顧客サービス、音声検索、字幕生成、オンライン教育などのシナリオで広く使用されています。エンタープライズレベルのユーザーは、Alibaba Cloud Bailian プラットフォームを通じて API を直接呼び出すことができます。
Fun-ASR1.5 のコスト上の利点
Fun-ASR1.5 は完全なオープンソース プロジェクトであり、その主な利点はライセンス費用がゼロであることです。
| コスト ディメンション | 説明 |
|---|---|
| ツールキットの使用法 | MIT ライセンス、完全に無料で商用利用可能 |
| モデルの重量 | モデル カード契約に従い、そのほとんどは商用利用が無料です。 |
| API 呼び出し (Alibaba Cloud Bailian) | 従量課金制の請求については、Alibaba Cloud のリアルタイム見積もりを参照してください。 |
| プライベート展開 | 独自のサーバーを構築し、インフラストラクチャのコストのみを負担 |
| 競合製品比較(Whisper API) | 自己展開では推論速度が 26 倍向上し、同じスループットでハードウェア コストが大幅に削減されます。 |
C 側のコスト: Moda Community を通じたオンライン エクスペリエンスは完全に無料で、ローカル展開には GPU を搭載したマシンのみが必要です (CPU は SenseVoiceSmall モデルも実行できます)。 ビジネスエンドのコスト: 企業は、Alibaba Cloud Bailian API を従量課金制で支払うか、データがドメイン外に流出するのを避けるためにプライベートにデプロイするかを選択できます。自己展開モードでは、Fun-ASR1.5 の推論効率により、同じハードウェア上の Whisper よりもはるかに高い同時実行性を実現できます。
Fun-ASR1.5の主な機能
-
多言語認識: 単一のモデルで、中国語、英語、日本語、韓国語、フランス語、ドイツ語、スペイン語、ポルトガル語、ロシア語、アラビア語を含む 30 の言語をカバーします。言語ごとに独立したモデルをデプロイする必要はありません。国境を越えた会議や多言語コンテンツの制作シナリオに適しています。
-
自動言語切り替え (コードスイッチング): 言語タグを事前に設定する必要はなく、同じ会話内で多言語が混在した音声を自動的に認識して処理します。これは、中国語と英語が混在するビジネス会議やテクノロジー ポッドキャストなどのシナリオで非常に実用的で、面倒な手動によるセグメンテーションの注釈付けが不要になります。
-
方言とアクセントの認識: 上海語、広東語、四川語、福建語などの需要の高い 15 の方言の最適化に重点を置き、7 つの主要な方言体系と 20 以上の地方のアクセントをカバーします。方言文字の誤り率は前バージョンに比べて56.2%減少し、本来の方言文字の復元をサポートしています。
-
古代詩の朗読認識: 『歌書』、『朱慈』、李白と杜甫の詩、蘇軾と辛斉記の慈詩などの古典テキストをカバーする実在の人物の朗読コーパスを文字レベルの精度 97% で構築しました。これは、中国研究教育と文化継承のデジタルシナリオにとって独特の価値を持っています。
-
インテリジェントな後処理: コンテキスト セマンティクスに基づいて、コンマ、ピリオド、疑問符などの句読点を自動的に挿入し、話された数字、日付、金額、電話などを標準化された書面形式に自動的に変換します。この機能により、会議議事録や法的記録などのシナリオのポストプロダクション手動編集時間を大幅に短縮できます。
Fun-ASR1.5 モデルとバージョンの進化
Fun-ASR1.5 は、反復を続けるオープンソース プロジェクトです。最新のメイン バージョンは FunASR 1.3.19 (2026 年 7 月 19 日にリリース) です。中心的な進化プロセスは次のとおりです。
| バージョン | 日付 | 主な変更点 |
|---|---|---|
| FunASR 1.3.19 | 2026-07-19 | リアルタイム WebSocket の長時間セッション診断ログが PyPI ドキュメントにパッケージ化 |
| FunASR 1.3.18 | 2026-07-19 | CLI 字幕セグメンテーションの回帰を修正し、SRT 出力が文ごとにセグメント化される |
| FunASR 1.3.17 | 2026-07-19 | SenseVoice llama.cpp ランタイムの改善、Windows CUDA サポート |
| FunASR 1.3.16 | 2026-07-18 | Fun-ASR-Nano PyPI から直接インストールされたリアルタイム WebSocket サービス |
| FunASR 1.3.15 | 2026-07-17 | ストリーミングの信頼性向上、Fun-ASR-Nano 互換性修正 |
| FunASR 1.3.3 | 2026-05-24 | funasr-server CLI、OpenAI 互換 API、MCP サーバー |
| ファン-ASR-ナノ-2512 | 2025-12-15 | Fun-ASR-Nano初のフラッグシップモデルを発売 |
モデル系統に関しては、FunASR ツールキットは複数のモデルの選択肢を提供します: Fun-ASR-Nano (中国語/英語/日本語 + 方言)、Fun-ASR-MLT-Nano (31 言語)、SenseVoiceSmall (5 言語 + 感情認識)、Paraformer (低遅延ストリーミング ASR)、Qwen3-ASR (52 言語) など。ユーザーはシーンの精度、言語範囲、ハードウェア条件に基づいて柔軟に選択できます。
Fun-ASR1.5 の技術的利点
Fun-ASR1.5 の中核となる技術的利点は、アーキテクチャ、推論効率、導入の柔軟性の 3 つのレベルに分類できます。
-
MoE ハイブリッド エキスパート アーキテクチャ: モデルには、複数の言語関連のエキスパート サブネットワークが含まれています。特定の言語が聞こえると、対応するエキスパート モジュールのみがアクティブになります。この設計により、30 言語をカバーする単一モデルのパラメーター効率が、同じスケールの高密度モデルのパラメーター効率よりもはるかに高くなります。推論時の計算量が大幅に削減されます。同時に、各エキスパート モジュールは、相互に干渉することなく独立して最適化できます。
-
段階的かつ段階的なトレーニング戦略: 正確なデータを使用して段階的にトレーニングします。最初に一般的な多言語の事前トレーニングを行い、次に方言/アクセントの微調整を行い、最後に特別なシーン (古代の詩など) の調整を行います。このトレーニング プロセスにより、現実世界の複雑な音声シナリオにおいてモデルが 1 段階でトレーニングされたモデルよりも大幅に堅牢になります。
-
フルリンク デプロイメント マトリックス: Python ライブラリ (
pip install funasr) から OpenAI 互換 API サービス (funasr-server) まで、llama.cpp/GGUF エッジサイド バイナリから Docker コンテナ化デプロイメントまで、MCP サーバーから vLLM バッチ推論エンジンまで、個人の開発マシンから大規模な運用クラスターまでの完全なデプロイメント ニーズをカバーします。特に、llama.cpp ランタイムは、Python ランタイムを必要とせずに純粋な CPU およびエッジ デバイスに FunASR をもたらし、IoT および組み込みシナリオにおいて独自の利点をもたらします。 -
最先端の推論パフォーマンス: Fun-ASR-Nano + vLLM は CPU 上で 340 倍のリアルタイム (RTFx) に達し、SenseVoiceSmall は 17 倍のリアルタイムに達します。 Whisper-large-v3 の 13 倍のリアルタイム (GPU) と比較すると、CPU 上での FunASR の推論速度は GPU 上での Whisper のパフォーマンスをさらに上回り、CPU カードレス導入が実現可能なソリューションになります。
Fun-ASR1.5 使い方
Fun-ASR1.5 はさまざまな利用方法を提供し、開発者はシナリオに応じて柔軟に選択できます。
| 入口 | 説明 |
|---|---|
| Python ライブラリ (pip) | pip install funasr、AutoModel API 経由で呼び出されます。 |
| CLIコマンドライン | funasr audio.wav は音訳であり、SRT/JSON 出力をサポートしています。 |
| OpenAI互換API | funasr-server --device cuda はサービスを開始します。POST /v1/audio/transcriptions |
| MCPサーバー | クロード/カーソルなどの AI エージェントが音声認識機能を呼び出す場合 |
| Magic Scope コミュニティのオンライン体験 | ブラウザを直接使用し、インストールは必要ありません: https://modelscope.cn/studios/iic/FunAudio-ASR |
| llama.cpp バイナリ | 純粋な CPU/エッジ実行、Python コンテキストは不要 |
Python をすぐに始めましょう: 「」パイソン funasr から AutoModel をインポート
モデル = AutoModel(モデル = "FunAudioLLM/Fun-ASR-Nano-2512", デバイス = "cuda") 結果 = model.generate(input="audio.wav") print(結果[0]["テキスト"]) 「」
CLI の 1 行転写: 「」バッシュ funasr audio.wav --output-format json --spk --timestamps 「」
API サービスを開始します: 「」バッシュ funasr-server --device cuda
サービス開始後、localhost:8000 に OpenAI 互換インターフェイスを提供します
「」
一般的な使用プロセス: FunASR をインストール → モデルをロード (重みを自動的にダウンロード) → オーディオ ファイル/ストリームを入力 → 構造化認識結果を取得 → 後処理 (句読点/正規化)。プロセス全体で言語タグを手動で設定する必要はなく、モデルが自動的に言語タグを認識します。
Fun-ASR1.5 の製品価格
Fun-ASR1.5 のオープンソース戦略により、コスト面で大幅なメリットが得られます。
- コミュニティ エディション (無料): PyPI 経由で GitHub リポジトリをダウンロードし、オンラインで Magic Community を体験してください。すべて無料です。 MIT オープンソース ライセンスにより、商用利用と二次開発が許可されます。
- Alibaba Cloud Bailian API (従量課金制): 独自のインフラストラクチャを構築したくないユーザーは、Alibaba Cloud Bailian プラットフォームを通じて API を呼び出し、呼び出し量に基づいて課金されます。具体的な価格は、Alibaba Cloud のリアルタイム価格ページに準拠します。
- 企業の民営化展開 (自己構築): 企業は独自のサーバーに展開でき、コンピューティング リソースのコストのみを負担する必要があります。 FunASR の高い推論効率を利用して、単一の GPU で多数の同時リクエストを処理できます。
商用音声認識サービス (Azure Speech、Google Cloud Speech-to-Text、Whisper API など) と比較して、Fun-ASR1.5 自己展開ソリューションの TCO (総所有コスト) は、中規模および大規模な使用シナリオで大きな利点があり、データがドメインの外に出ないため、コンプライアンス要件を満たします。
Fun-ASR1.5の適用シナリオ
-
多言語会議と多言語文字起こし: 多国間会議中に、多言語が混在した対話コンテンツをリアルタイムで正確に文字起こしします。事前に言語をプリセットする必要はありません。 1 つのモデルで 30 の言語をカバーできます。句読点とテキストの自動正規化により、後処理コストが大幅に削減されます。
-
インテリジェントなカスタマー サービス音声分析: カスタマー サービスの通話録音を構造化テキストにバッチ転写し、方言認識と話者の分離をサポートし、サービス品質の監視、ホットイシューのマイニング、感情分析に使用します。
-
オンライン教育と中国学のデジタル化: 古代詩の朗読認識の 97% の文字精度により、学生の朗読をリアルタイムでテキストに翻訳し、比較および採点を行うことができる、オンライン中国学教育のためのユニークなツールとなっています。
-
コンテンツ制作と字幕生成: ビデオ作成者は、CLI の 1 行コマンドを使用して、音声を SRT 字幕ファイルに転写できます。話者タグとタイムスタンプをサポートしており、ポッドキャスト、コースビデオ、ニュースインタビューなどのコンテンツ制作に適しています。
-
IoT とエッジ デバイス間の音声対話: llama.cpp/GGUF を介して実行する場合、Fun-ASR1.5 は純粋な CPU デバイス上で実行でき、スマート スピーカー、車の音声、産業用制御などのエッジ シナリオに適しています。
Fun-ASR1.5の適用グループ
-
AI アプリケーション開発者: 音声認識を独自のアプリケーションに統合する必要がある開発者は、Python SDK、REST API、または MCP サーバーを通じて音声認識にすばやくアクセスできます。
pip install funasrが起動できます。 -
エンタープライズ IT およびデータ チーム: 音声認識サービスの展開を民営化する必要がある企業向けに、FunASR はドメイン外にデータを出さないようにサポートするための完全な展開マトリックス (Docker、Kubernetes、OpenAI 互換 API) を提供します。
-
研究機関および学術ユーザー: オープンソースのモデル重みと完全なトレーニングおよび微調整ツール チェーン。音声認識、弁証法、多言語 ASR およびその他の方向の研究作業に適しています。
-
コンテンツ クリエーターおよびメディア担当者: オーディオ/ビデオを素早くテキストに変換し、字幕を生成する必要があるクリエイター。 CLI は 1 行のコマンドでトランスコーディングを完了でき、SRT/JSON/VTT などの形式での出力をサポートします。
-
群衆には適していません: 超低遅延 (エンドツーエンド 100 ミリ秒未満) に対する厳しい要件があるリアルタイム通信シナリオの場合は、テスト後に評価することをお勧めします。純粋にクラウドフリーの運用およびメンテナンスのホスティング サービスを必要とするユーザーは、自己展開ではなく Alibaba Cloud Bailian API を優先することをお勧めします。コマンドラインや Python プログラミングに詳しくない純粋なビジネス ユーザーは、Alibaba Cloud Bailian ビジュアル インターフェイスまたはサードパーティ統合を使用する必要があります。
Fun-ASR1.5の概要と展望
Fun-ASR1.5 は、音声認識分野における Alibaba Tongyi チームの重要なオープンソース成果です。その核となる競争力は次のとおりです。単一モデルの多言語対応 (30 言語 + 7 つの主要な方言) により、マルチモデル展開の運用と保守の複雑さが軽減されます。 MoE アーキテクチャによってもたらされる推論効率により、同じハードウェア上の競合製品をはるかに上回るスループットを達成できます。フルリンク オープン ソース戦略 (MIT プロトコル + 完全な導入ツール チェーン) は、企業や開発者に低コストで高度に制御可能な音声認識インフラストラクチャを提供します。
制限事項: モデルの重みは無料で使用できますが、モデルごとにライセンス契約が異なり、商用利用する前に特定のモデル カードの認可条件を確認する必要があります。超低遅延のストリーミング シナリオ (リアルタイムのインターコム変換など) では、引き続きターゲットを絞った調整が必要です。リソースが非常に少ないエッジ デバイス (MCU レベル) の場合、llama.cpp ランタイムは引き続き最適化されています。
調達/採用リスク評価: Alibaba Damo Academy によって維持されるオープンソース プロジェクトとして、FunASR は長期的かつ安定したコミュニティと企業のサポートを受けており、193,000 の GitHub スターと 178 人の貢献者がそのエコ活動を証明しています。企業は導入時に注意する必要があります。オープンソース バージョンでは SLA 保証が提供されず、主要な運用企業は Alibaba Cloud Bailian API を通じてエンタープライズ レベルのサポートを受けることが推奨されます。商用利用の前に、モデル重量に関する独立したライセンス契約を 1 つずつ確認する必要があります。プロジェクトの反復リズムは速いため (毎月、複数の小さなバージョンがリリースされます)、運用企業はバージョンをロックし、回帰テストを行う必要があります。全体として、Fun-ASR1.5 は現在、自己構築機能とデータ コンプライアンス要件を持つチームにとって、中国語音声認識の分野で最もコスト効率の高いオープン ソース オプションの 1 つです。
関連ツール: イレブンラボ、udio
バージョン情報
- FunASR 1.3.19 :リアルタイムの WebSocket 長時間セッション診断機能が追加され、CLI 字幕の生成と句読点の読み込みが改善され、コミュニティ ドキュメントが更新されました。
- FunASR 1.3.18 :SRT 字幕セグメンテーション回帰問題を修正し、文レベルのタイムスタンプ要求をサポートし、句読点モデルの読み込みを改善しました。
- FunASR 1.3.17 :リアルタイムの WebSocket セッション診断ログ、SenseVoice llama.cpp ランタイムの改善、Windows CUDA サポートが追加されました。
- FunASR 1.3.16 :Fun-ASR-Nano リアルタイム WebSocket サービスは、PyPI から直接インストールでき、クライアント駆動のエンドポイント モードをサポートします。
- FunASR v1.3.15 :ストリーミングの信頼性を向上させ、Fun-ASR-Nano の互換性の問題を修正し、CLI とテキスト処理を改善します。
ユーザーレビュー