3Dスピーカー 無料

-

3D-Speaker は、シングル/マルチモーダル話者検証、話者識別、話者ログ分離のための Alibaba Cloud ModelScope のオープンソース ツールキットです。 ERes2Net、CAM++、ECAPA-TDNN などの事前トレーニング済みモデルと大規模な 3D スピーカー音声データ セットを提供し、音声と視覚を統合するマルチモーダル話者ログをサポートします。

3Dスピーカー 製品インターフェース

3D スピーカー

3D スピーカーのコアパラメータと統計

3D-Speaker は、Alibaba Cloud ModelScope コミュニティが提供するオープンソースのシングル/マルチモーダル スピーカー検証、認識、ログ分離ツールキットです。音声技術開発者や AI 研究者に、モデルのトレーニングから生成推論までの完全なツール チェーンを提供します。名前に含まれる「3D」は、3 次元の視覚ではなく、データ セットの 3 つの次元、つまりマルチデバイス、マルチディスタンス、マルチ方言を表しています。

プロジェクト 広報
製品のポジショニング オープンソースのシングル/マルチモーダル話者検証およびログ分離ツールキット
コアテクノロジースタック ディープラーニング (ResNet、Res2Net、ECAPA-TDNN、ERes2Net、CAM++、SDPN など)
事前トレーニング済みモデルの数 10+ (話者検証、言語識別、自己教師あり学習をカバー)
ライセンス契約 Apache ライセンス 2.0
サポートされているプラ​​ットフォーム Linux、macOS、デスクトップ、API
プログラミング言語 Python (54%)、シェル (27%)、Perl (15%)、C++ (3%)
GitHub スター ~3,100
GitHub フォーク ~267
寄稿者 8名(2026年7月現在)
所属団体 アリババ DAMO アカデミー / モデルスコープ
所属場所 CN
リンクされたデータセット 3D スピーカー データセット (10,000 以上のスピーカー、190 GB のトレーニング データ)
学術論文 ICASSP 2025 承認

一言で簡単にレビュー: 3D-Speaker は音声アシスタント製品ではなく、ModelScope によって作成されたプロフェッショナルな声紋認識オープンソース ツール ライブラリです。これにより、開発者は「音声を聞いて人物を識別する」製品レベルの機能を低コストで構築でき、それに一致する大規模なベンチマーク データ セットを提供できます。

コア機能境界: 3D スピーカーは「誰が話しているのか」というタスクに焦点を当てており、ASR (音声テキスト変換)、TTS (音声合成)、または NLP の意味理解は提供しません。これは音声対話パイプラインにおける ID 認識の問題を解決し、完全な対話システムを形成するには他の音声モジュールと組み合わせる必要があります。

3D スピーカーのユーザーと市場の認識

声紋認識技術は、学術研究から大規模な産業応用への移行の重要な段階にあり、金融​​アイデンティティ認証、インテリジェントな会議分析、スマートホームのパーソナライゼーションなどのシナリオで、「音声を聞いて人物を識別する」という需要が高まり続けています。しかし、高品質のオープンソース ツール チェーンの欠如により、産業での実装の速度が長い間制限されてきました。この文脈において、3D-Speaker は ModelScope エコシステム (Alibaba Cloud の AI オープンソース プラットフォーム) に依存しており、中国語話者認識の分野で最も影響力のあるオープンソース プロジェクトの 1 つとなっています。

コミュニティでの評価: GitHub リポジトリは、約 3,100 個のスターと 267 個のフォークを受け取りました。同様のオープンソース プロジェクト (約 4.5,000 スターの WeSpeaker、約 9,000 スターの SpeechBrain など) と比較して、3D-Speaker は中国の音声技術コミュニティの第一階層で認められています。主要な違いは、大規模なマルチデバイス/マルチ距離/マルチ方言データ セットとベースライン モデルの完全なセットの「データ + コード」統合ソリューションを提供することです。

学術的な影響: 3D スピーカー関連の論文が ICASSP 2025 (音声分野のトップ学術会議) に採択されました。その論文のタイトルは「3D-Speaker-Toolkit: An Open Source Toolkit for Multi-modal Speaker Verification and Diarization」です。付属の 3D 話者データセットの論文 (arXiv 2306.15354) は、音声表現デカップリング研究のための 14 の中国語方言の 10,000 人以上の話者による大規模なベンチマークを提供しており、多くの研究者によって引用されています。

産業上の採用: 声紋認識は、金融コンプライアンスのシナリオにおける「強化された ID 認証」のための主要なテクノロジーの 1 つです。 Alibaba Cloud エコシステムに依存する 3D-Speaker は、ModelScope プラットフォームの事前トレーニング済みモデルのダウンロードとオンライン推論サービスを通じて、金融、セキュリティ、会議、その他の業界の開発者ユーザーをカバーします。特定の企業レベルの導入データは公開されていませんが、ModelScope プラットフォームの話者検証モデル ページのダウンロードは間接的な参照として使用できます。

競合製品との違い: pyannote.audio (フランスのチームによって開発され、日記作成に重点を置いている)、SpeechBrain (総合音声ツールキット)、WeSpeaker (話者認識に重点を置いている) などの国際的な主流ツールと比較すると、3D-Speaker の主な利点は 3 点にあります。1 つは、大規模な中国語の複数の方言データ セット (3D-Speaker-Dataset) を提供することです。 2 番目に、シングルモーダル (ピュア オーディオ) ソリューションとマルチモーダル (オーディオとビデオの融合) ソリューションの両方をカバーしています。 3 番目に、ERes2NetV2 や CAM++ などのモデル アーキテクチャで優れたベンチマーク結果を維持し続けています。

3D スピーカーのコスト上の利点

3D-Speaker の価格モデルは非常にシンプルで、Apache 2.0 オープン ソース ライセンスの下では完全に無料です。しかし、「オープンソースと無料」の背後にある実際のコスト構造は、役割ごとに分類する必要があります。

C クライアント/個人開発者: コードと事前トレーニングされたモデルは完全に無料でダウンロードして使用できます (Apache 2.0 ライセンス)。個人の開発者は、ライセンス料なしでネイティブ GPU (RTX 3090/4090 など) で推論を実行できます。 3D スピーカー データセット (約 190 GB) も無料で利用できますが、ダウンロードには帯域幅と時間のコストが必要です。

API/開発者: 公式のホスト API 価格はありません - 3D-Speaker は、ModelScope プラットフォーム上でスタンドアロンの有料 API を提供しません (DeepSeek API などの基本モデルの商用 API モデルとは異なります)。開発者は以下を選択できます。

  • 自己展開モード: 独自のサーバーで推論を実行します。コストはハードウェア投資に完全に依存します。単一話者検証推論は、民生用 GPU では数十ミリ秒で完了できます。スループットのボトルネックは主に音声アクティビティ検出 (VAD) と特徴抽出前の音声デコード段階にあります。
  • ModelScope オンライン推論: ModelScope プラットフォームは、一部の事前トレーニング済みモデルに対してオンライン エクスペリエンス サービスを提供しますが、主に機能検証に使用され、同時実行性の高い運用シナリオには適していません。具体的な使用制限は ModelScope の公式ページに準拠します。

エンタープライズ/プライベート: Apache 2.0 ライセンスでは、ライセンス料なしで無料の商用使用、変更、再配布が許可されています。ただし、企業は次のような明確な投資を行う必要があります。

  • GPU インフラストラクチャ: 1 枚のカード A100-80G で、ERes2NetV2 (17.8M パラメータ) などの主流モデルのバッチ推論を実行できます。大規模なダイアライゼーション タスク (数十時間の会議音声など) には、より高スペックの CPU/GPU リソース構成が必要です。
  • データ収集と注釈: 声紋認識システムの実際のパフォーマンスは、対象のシーンに一致するデータに大きく依存します。デバイス間 (PC マイクから電話チャネルへの切り替えなど) および距離間 (近距離と遠距離) の認識精度は大幅に低下します。通常、企業は対象シーンの音声データをさらに収集し、ドメインの微調整を行う必要があります。この暗黙的なコストは、多くの場合、モデル自体の使用コストを超えます。
  • システム統合投資: 声紋認識モジュールは既存の ASR、VAD、NLP およびその他のパイプラインと接続する必要があり、これにはエンジニアリングの人的投資が伴います。

コストの比較: オープンソース ツールと商用 API:

費用項目 3D スピーカー (オープンソースおよび自己展開) 商用声紋 API (Alibaba Cloud 声紋認識など)
ライセンス料 ゼロ 通話量に応じて請求
GPUサーバー(月々の見積り) 5,000~50,000元(規模による) ゼロ (API 呼び出し)
運用保守マンパワー エンジニアによるメンテナンスが必要 ゼロ
シーン適応の微調整 自己投資 カスタマイズは通常サポートされていません
データプライバシー 完全にローカライズされた クラウド サービス プロバイダーへの依存
スケール後の限界費用 ゼロに近い(電気代のみ) 通話量に応じて直線的に増加

隠れたコストのヒント: 3D スピーカーの EER は、VoxCeleb や CNCeleb などの標準テスト セットでは 0.52% と低い場合がありますが、これらの数値は管理された実験室条件下で得られたものです。現実世界のシナリオ (無音でない状況、携帯電話の通話、子供や高齢者の話者など) では、認識精度が大幅に低下します。モデルを実稼働環境に導入する前に、ターゲット シーン データに対して少なくとも 2 週間グレースケール テストを実施し、事前トレーニングされたモデルと微調整されたモデルのパフォーマンスのギャップを比較する必要があります。

3D-Speakerの主な機能

3D スピーカーの中核機能は、「音声から話者の身元を識別する」というタスクを中心に展開しており、相互に関連する 4 つの機能モジュールが含まれます。

  • 話者検証: 1:1 の ID 認証。スピーチが宣言された話者に属しているかどうかを検証します。これは、金融本人確認とシステム ログインの中核となるシナリオです。 3D スピーカーは、ERes2NetV2、CAM++、ECAPA-TDNN などの複数のモデルを提供し、VoxCeleb テスト セットの EER は 0.52% (ERes2Net-Large) から 1.56% (Res2Net) の範囲です。 実装に関する懸念事項: 検証しきい値の選択は、セキュリティとユーザー エクスペリエンスを直接トレードオフします。しきい値が厳しすぎると、セキュリティは向上しますが、ユーザーの拒否率が高くなります。ビジネスセキュリティレベルを決定するために、ROC曲線分析を実施することをお勧めします。

  • 話者の識別: 1:N の識別マッチング。登録された話者セットから現在の音声がどの既知の識別に属しているかを識別します。容疑者捜査やVIP顧客の自動識別などのシナリオに適しています。 実装に関する懸念事項: 登録セットのサイズが増加すると、認識精度が低下します。大規模なシナリオ (10,000 人を超える) では、階層インデックス作成または ANN アクセラレーションを導入することをお勧めします。

  • 話者ダイアライゼーション: 「誰が何時に話したか」に従って複数人の音声を分割してラベル付けし、タイムスタンプ + 話者ラベルを出力します。これは、会議分析と顧客サービス品質検査の中核となる前提条件機能です。 3D スピーカーのダイアライゼーション パイプラインには、5 つのプラグイン可能なモジュールが含まれています: 重複音声検出 (オプション) → 音声アクティビティ検出 → 音声セグメンテーション → 話者埋め込み抽出 → 話者クラスタリング。 Aishell-4 データセットでは、DER (ダイアライゼーションエラー率) が 10.30% に達する可能性があります。 実装に関する懸念事項: 重複の検出が現在のプロジェクトのボトルネックです。2 人以上の人が同時に話す場合、従来のダイアライゼーション スキームでは、重複する領域を話者の 1 人に誤って割り当てたり、ノイズとしてマークしたりして、情報損失が発生します。 3D スピーカーは、この問題を軽減するために、オプションの重複検出モジュールを提供します。

  • 言語の識別: スピーチの言語の種類を識別します (現在は中国語と英語に焦点を当てています)。 CAM++ モデルに基づくと、3D スピーカー データ セットでは 29.36% の EER が達成されます (言語認識は主に精度に基づいており、この EER は参照のみです)。多言語コールセンターの自動ルーティング シナリオに適しています。

  • マルチモーダル スピーカー ダイアライゼーション: オーディオとビデオ画像入力の融合。唇の動きと顔の動きの特徴は、TalkNet-ASD モデルを通じてビデオから抽出され、音声特徴との共同推論は、重複する音声シナリオにおいて音声のみのソリューションよりも大幅に優れています。音声データとビデオ データの両方を含むビデオ会議やインタビュー記録などのシナリオに適しています。

  • 自己教師あり話者検証 (自己教師あり SV): RDINO と SDPN という 2 つの自己教師ありトレーニング ソリューションを提供します。これらは、ラベルのない音声データで話者表現を学習し、高品質の注釈付きデータへの依存を軽減できます。大規模なラベルなし音声データの事前トレーニング シナリオに適しています。

[エキスパートビュー: 機能的相乗効果]: これら 4 つの機能は、完全な「音声→話者タグ」処理パイプラインを形成します。 - ダイアライゼーションにより、さまざまな話者の音声セグメントが分離されます。 → 検証/識別により、各セグメントに同一性のラベルが付けられます。 → 言語識別により、言語のメタ情報が補足されます。実際のエンジニアリングの導入では、ダイアライゼーションのセグメンテーションの精度 (特に重複する音声セグメンテーションの品質) がパイプライン全体のボトルネックになります。セグメンテーション エラーは検証セクションに直接渡され、その結果 ID アノテーション エラーが発生します。検証モデル自体の精度だけに焦点を当てるのではなく、VAD とパイプラインのセグメンテーションにより多くのチューニング リソースを投資することをお勧めします。

3D スピーカーのモデルとバージョンの進化

3D-Speaker は、「機能の反復がバージョンの進化を促す」モードで継続的に更新されます。 GitHub リポジトリには、従来の意味的なバージョン番号はありません (v1.0、v2.0 などのリリースはありません) が、「新モデルまたは新機能の月次/四半期リリース」の形式でプロモーションされます。以下は、README の新機能タイムラインに基づいてバージョン コンテキストを再構成したものです。

フェーズ 1: データセットとベースライン モデルのリリース (2023.06 ~ 2023.11)

  • 2023.06: 3D スピーカー データセットが正式にリリースされました。これには、14 の中国語の方言、マルチデバイス (PC、レコーダー、アレイ、モバイル iPad) およびマルチ距離 (0.1 m ~ 4 m) ラベルの 10,000 人以上のスピーカーが含まれます。同時に、ベースライン モデルと、ERes2Net、CAM++、RDINO などのサポート ベンチマークがリリースされました。
  • 2023.07: CAM++、ERes2Net-Base、および ERes2Net-Large の事前トレーニング モデルが ModelScope プラットフォームで開始されました。ダイアライゼーションのセマンティックな側面を強化するために、ダイアログ検出モジュールとセマンティック話者切り替え検出モジュールがリリースされました。
  • 2023.08: CN-Celeb データセットに対する CAM++、ERes2Net-Base、ERes2Net-Large のベンチマーク結果をリリース。中国語と英語の言語認識モデルをリリースしました。
  • 2023.09: CN-Celeb データセット上の RDINO 自己教師あり話者検証モデルのトレーニングと推論のレシピをリリースしました。
  • 2023.10: 3 つのデータセット (3D-Speaker、VoxCeleb、CN-Celeb) に対する ECAPA-TDNN のトレーニングおよび推論レシピをリリースしました。
  • 2023.11: 20 万話者の中国語標準語データセットに基づいてトレーニングされた、ERes2Net ベースの事前トレーニング済みモデルがリリースされました。

フェーズ 2: モデル システム拡張 (2024.01 ~ 2024.08)

  • 2024.01: 3 つのデータ セットをカバーする ResNet34 および Res2Net モデル レシピをリリースしました。利益率の高いファインチューンレシピと日記推論レシピを公開。
  • 2024.02: 音素情報を統合して言語認識の精度を向上させる言語認識レシピをリリースしました。オーディオとビデオ入力を統合するためのマルチモーダルダイアライゼーションレシピをリリースしました。
  • 2024.04: ONNX フォーマットへのモデルのエクスポートと CPU/エッジ デバイスでの効率的な推論をサポートする ONNX Runtime 推論ランタイムをリリースしました。は、より少ないパラメーターとより高速な推論を備えた ERes2NetV2 モデルを VoxCeleb でリリースしました。
  • 2024.05: SDPN 自己教師ありモデル X ベクトル モデルのトレーニングと推論のレシピをリリースしました。マルチモーダル話者認識機能を拡張するビジョン モジュール (TalkNet-ASD) とセマンティック モジュール (BERT) のレシピをリリースしました。
  • 2024.08: EER とパラメーター サイズの間のより良いバランスを達成するために 200k スピーカー データセットでトレーニングされた ERes2NetV2 および ERes2NetV2_w24s4ep4 事前トレーニング モデルをリリースしました。

第 3 フェーズ: エンジニアリングとベンチマークの改善 (2024.12)

  • 2024.12: Aishell-4、Alimeeting、AMI、VoxConverse、Meeting-CN などの複数のパブリック マルチスピーカー データセットで再現可能な DER ベンチマークを提供するための完全に更新されたダイアライゼーション レシピ。これは最新のメジャー バージョンであり、3D-Speaker が純粋な研究ツールから再現可能なエンジニアリング ベンチマークへの変換を示します。

バージョン ポリシー ステートメント: 3D-Speaker はセマンティック バージョン番号のリリースに従っておらず、GitHub のリリース ページには公式のリリース記録がありません。ユーザーは、Git コミット履歴 ModelScope モデル ページと README 更新ログに注意して最新の変更を追跡する必要があります。このリリース方法ではメンテナンス コストが削減されますが、ユーザーが単一のバージョン番号でコードの安定性を判断することも困難になります。運用環境で使用する場合は、特定のコミットをロックすることをお勧めします。

3D スピーカーの技術的利点

3D スピーカーの技術的利点は、特定のモデル アーキテクチャの画期的な進歩だけではなく、データからモデル、トレーニングから展開までのリンクを完全にカバーしていることにもあります。以下は、建築イノベーションとエンジニアリングの 2 つの側面から分解されます。

モデル アーキテクチャの系統: 3D スピーカーは、8 つ以上の話者検証モデル アーキテクチャを統合し、さまざまな規模とアプリケーション シナリオをカバーします。

モデル パラメータ VoxCeleb EER CNセレブEER 3DSスピーカーEER 特長
レス2ネット 4.03M 1.56% 7.96% 8.03% 軽量ベースライン
レスネット34 6.34M 1.05% 6.92% 7.29% 古典的な建築
ECAPA-TDNN 20.8M 0.86% 8.01% 8.87% 競争力のあるベースライン
ERes2Netベース 6.61M 0.84% 6.69% 7.21% 高いコストパフォーマンス
CAM++ 7.2M 0.65% 6.78% 7.75% 効率的な畳み込み
ERes2NetV2 17.8M 0.61% 6.14% 6.52% 高精度の推奨
ERes2Net-large 22.46M 0.52% 6.17% 6.34% 最高の精度

メカニズム→効果→シーンの因果連鎖: 話者検証の技術的核心は、可変長音声から固定次元の「識別話者埋め込み」(Speaker Embedding) を抽出することです。 ERes2NetV2 は、残留接続の階層設計を通じてマルチスケールの時間周波数機能を統合し、パラメーターの数を 14% 削減すると同時に、EER を 0.84% (ERes2Net ベース) から 0.61% に削減します。これは、エラー率がゼロに近いシナリオ (財務リスク管理など) では、ERes2NetV2 がより低い計算コストで同じセキュリティしきい値を達成できることを意味します。適用可能なシナリオは、高精度の話者検証を必要とし、推論遅延の影響を受けやすい運用環境です。

CAM++ の革新的な利点: CAM++ (コンテキスト アテンション モジュール) は、3D スピーカー チームによって提案された効率的な畳み込みアーキテクチャです。 VoxCeleb では 720 万という極めて低いパラメータ量で 0.65% の EER に達し、ERes2NetV2 (1780 万) のレベルに近づきます。パラメータ効率(EER/パラメータ量比)は全機種中最高です。デバイスまたはモバイル デバイスに導入する必要がある声紋認識シナリオの場合、CAM++ が優先的に評価する価値があります。

ダイアライゼーション パイプライン エンジニアリング: 3D スピーカーのダイアライゼーションはモジュール式パイプライン設計を採用しており、各ステージを個別に交換または最適化できます。

  • 重複音声検出 (シーケンス ラベリング モデルに基づく) → 複数の人が同時に話している領域を識別するオプションのモジュール
  • 音声アクティビティ検出 (VAD) → 無音クリップや音声以外のクリップを削除
  • 話者のセグメンテーション (BERT または固定ウィンドウに基づく) → 音声を話者同種のセグメントに分割します。
  • 話者エンベディングの抽出 → ERes2NetV2/CAM++ などのモデルを使用してセグメントレベルのエンベディングを抽出します
  • 話者クラスタリング (スペクトル クラスタリング/アフィニティ伝播) → 異なる話者へのクラスタの埋め込み

Aishell-4 と Alimeeting のベンチマークでは、パイプラインはそれぞれ 10.30% と 19.73% の DER を達成し、同時期の Kaldi ベースライン (それぞれ約 12.2% と 24.4%) よりも大幅に優れており、モジュラー設計の相乗効果が実証されました。

マルチモーダル フュージョン メカニズム: 3D スピーカーのオーディオとビデオのフュージョン ダイアライゼーション ソリューションは、TalkNet-ASD を通じてビデオから唇の動きと顔の動きの特徴を抽出し、埋め込みレベルでオーディオの特徴と結合して、統合クラスタリング モジュールに送信します。重複する音声の割合が高いシナリオでは、音声が欠落している場所で視覚情報がスピーカー切り替え境界信号を提供し、DER を約 3 ~ 5 パーセント ポイント削減します。適用可能なシナリオには、ビデオ会議、ライブインタビュー、ニュース番組、およびマルチカメラビデオデータを使用するその他の分野が含まれます。

ONNX ランタイム展開の最適化: 3D-Speaker は ONNX モデルのエクスポートと推論スクリプトを提供し、PyTorch でトレーニングされたモデルの ONNX 形式への変換と CPU またはエッジ デバイスへの展開をサポートします。モデルが定量的に最適化された後、推論レイテンシは PyTorch 動的グラフの 1/3 ~ 1/2 に削減でき、メモリ使用量は約 40% 削減されます。 GPU のないサーバー環境では、ONNX 導入が声紋認識機能を運用環境に導入するための最も低コストのパスです。

制限と適応境界: 3D スピーカーの事前トレーニング済みモデルは、主に 16kHz のサンプリング レートの音声信号を対象としています (8kHz の電話音声には追加の適応が必要です)。現在のモデルは中国語と英語のシーンで最適に機能します。小規模な言語、超低リソース言語、または型破りなサンプリング レートを使用するシナリオの場合、自己教師ありスキーム (RDINO/SDPN) を使用して、ターゲット データの事前トレーニングまたは微調整を行う必要があります。

3D スピーカーの使用方法

3D スピーカーは、ローカル コードの実行と ModelScope プラットフォームのオンライン推論という 2 つの使用パスを提供します。

パス 1: ローカル クローン コードを実行する (開発者に推奨)

「」バッシュ

リポジトリのクローンを作成する

git clone https://github.com/modelscope/3D-Speaker.git cd 3Dスピーカー

Python 3.8 コンテキストを作成し、依存関係をインストールする

conda create -n 3D スピーカー python=3.8 conda は 3D スピーカーをアクティブにします pip install -r 要件.txt 「」

トレーニング レシピの例 (例として 3D スピーカー データセット上の ERes2NetV2 の話者検証を取り上げます):

「」バッシュ cd egs/3dspeaker/sv-eres2netv2/ bash run.sh 「」

推論に事前トレーニングされたモデルを使用する: ModelScope ライブラリを通じて推論用に事前トレーニングされたモデルを読み込みます。

「」バッシュ pip インストールモデルスコープ 「」

「」パイソン

単一ファイルの話者検証推論

model_id = "iic/speech_eres2netv2_sv_zh-cn_16k-common" python Speakerlab/bin/infer_sv.py --model_id $model_id

バッチ推論

python Speakerlab/bin/infer_sv_batch.py --model_id $model_id --wavs wav_list.txt

自己教師ありモデル推論 (SDPN、VoxCeleb トレーニングに基づく)

model_id = "iic/speech_sdpn_ecapa_tdnn_sv_en_voxceleb_16k" python Speakerlab/bin/infer_sv_ssl.py --model_id $model_id 「」

話者ログ推論 (ダイアライゼーション):

「」バッシュ

ピュアオーディオダイアライゼーション

python Speakerlab/bin/infer_diarization.py --wav audio.wav --out_dir ./output

重複音声検出を有効にする (HuggingFace トークンが必要)

python Speakerlab/bin/infer_diarization.py --wav audio.wav --out_dir ./output \ --include_overlap --hf_access_token $hf_access_token 「」

パス 2: ModelScope オンライン エクスペリエンス

ModelScope Speaker Verification モデル ページ にアクセスし、対応する事前トレーニング済みモデルを選択し、テスト用に音声をオンラインにアップロードします。モデルの機能を迅速に検証するのには適していますが、運用コンテキストの統合には適していません。

パス 3: ONNX 導入 (エッジ デバイス/CPU 推論)

「」バッシュ cd ランタイム/onnxランタイム

PyTorch モデルを ONNX にエクスポートして推論を実行するには、このディレクトリ内のドキュメントを参照してください。

「」

利用可能な事前トレーニング済みモデルのリスト (すべて ModelScope 経由で配布):

モデルID 説明 データセット
iic/speech_eres2net_sv_zh-cn_16k-common ERes2Net、200k スピーカー 北京語
iic/speech_eres2netv2_sv_zh-cn_16k-common ERes2NetV2、200k スピーカー 北京語
iic/speech_campplus_sv_zh-cn_16k-common CAM++、200k スピーカー 北京語
iic/speech_sdpn_ecapa_tdnn_sv_en_voxceleb_16k SDPN 自己監視 VoxCeleb (英語)
iic/speech_campplus_lre_en-cn_16k CAM++ 言語認識 中国語と英語
iic/speech_eres2net_base_lre_en-cn_16k ERes2Net 言語識別 中国語と英語

3D スピーカー データ セットのダウンロード:

「」バッシュ

トレーニング セット (~190GB)

wget https://speech-lab-share-data.oss-cn-shanghai.aliyuncs.com/3D-Speaker/train.tar.gz

テストセット (~1.1GB)

wget https://speech-lab-share-data.oss-cn-shanghai.aliyuncs.com/3D-Speaker/test.tar.gz

テキストを転写する

wget https://speech-lab-share-data.oss-cn-shanghai.aliyuncs.com/3D-Speaker/transcription.tar.gz 「」

ヒント: 3D-Speaker には公式の Docker イメージがなく、公式ドキュメントは主に中国語の README です。運用ユーザーの場合は、依存関係のバージョン変更による一貫性のない動作を避けるために、特定の Git コミットをロックし、Docker イメージを自分でビルドすることをお勧めします。

3D スピーカーの製品価格

3D スピーカーは Apache 2.0 オープン ソース プロトコルを採用しており、商用の充電モデルはありません。具体的な用語:

  • 使用範囲: ソフトウェアのコピーを自由に使用、コピー、変更、結合、配布、サブライセンスおよび/または販売することが許可されています。
  • 商用制限: なし - Apache 2.0 プロトコルは商用に適しており、オープンソースの派生作品を必要としません。
  • 帰属要件: 派生作品では、元の著作権表示と寄稿者のリストを保持します。
  • 保証の免責事項: 適用法で義務付けられている場合、または書面で同意されている場合には、明示的か黙示的かを問わず、いかなる保証も提供されません。
  • モデル重みライセンス: 事前トレーニングされたモデル重みは ModelScope プラットフォームでホストされており、その使用条件は ModelScope の各モデル カード ページに記載されているライセンスの対象となり、コード リポジトリの Apache 2.0 契約とは異なる場合があります。
  • データセット ライセンス: 3D スピーカー データセットのメタデータは CC BY-SA 4.0 ライセンスに基づいてリリースされており、オーディオ コンテンツのオリジナルの著作権はオリジナルのデータ所有者に属します。

参考価格: ライセンス料はゼロです。企業ユーザーの総所有コストの計算式は、「TCO = GPU/サーバーの購入またはレンタル料金 + 運用保守マンパワー × 月数 + シナリオ適応データ収集コスト」となります。 1 日あたり 1,000 時間未満の音声を処理する中規模のシナリオの場合、自己展開の TCO は、従量課金制の商用 API の TCO よりも大幅に低くなります。

3D スピーカーの応用シナリオ

声紋認識が実験室から産業実装に移行するための中心的な推進力は、コンプライアンス ID 認証、会議インテリジェンス、スマート ホームのパーソナライゼーションという 3 つの方向から来ています。以下は、3D スピーカーの機能境界に基づいたシナリオベースの分析です。

  • 金融 ID 認証と詐欺防止: テレフォン バンキングやモバイル カスタマー サービスなどのリモート ID 検証シナリオでは、声紋認証はパスワード/PIN コードの補足または代替として機能します。 3D-Speaker の話者検証モデルを IVR システムに統合すると、ユーザーの通話の最初の 3 ~ 5 秒以内に ID 比較を完了できます。 コスト削減と効率の向上: 声紋認証の導入前、金融顧客サービスのパスワードのリセットと本人確認には、平均 45 ~ 60 秒の手動処理時間が必要でした。声紋検証を統合すると、日常的な本人確認が 10 秒以内に自動的に完了し (音声アクティビティ検出 + 特徴抽出 + 比較を含む)、手動介入が約 70% 削減されます。 検証の重要なポイント: 電話チャネル (8kHz サンプリング レート) での認識精度、短い音声 (3 秒未満) シナリオでの真正性拒否率、非自発的録音 (詐欺師によって再生された録音) に対する生体検出防御機能。 3D スピーカー自体はスプーフィング対策モジュールを提供していないため、ASVspoof などのライブ検出ソリューションを追加で統合する必要があります。

  • 会議分析とインテリジェントな議事録: エンタープライズ会議の録音は、さまざまな発言者の音声クリップを自動的に分離し、ASR と組み合わせて発言者ラベル付きの会議議事録を生成します。 3D スピーカーのダイアライゼーション パイプラインは、このシナリオの中心です。 コスト削減と効率の向上: 従来、1 時間の会議議事録を手動で編集するには約 2 ~ 3 時間かかりました。自動ダイアライゼーション + ASR パイプラインを使用すると、1 時間の音声処理が 15 ~ 30 分で完了し、効率が 4 ~ 10 倍向上します (GPU 推論時間に基づく)。 検証の焦点: 複数の人が同時に話したときのセグメンテーションの精度 (重複した発話) - 会議室での一般的な「中断」および「同時発話」シナリオ。従来のダイアライゼーション ソリューションでは、重複する領域が間違った話者としてマークされます。この改善ソリューションは、3D スピーカーのオプションの重複検出モジュールによって緩和する必要があります。ビデオ会議の場合は、重複するシーンの認識堅牢性を向上させるために、マルチモーダル ダイアライゼーション (音声とビデオの融合) を有効にすることをお勧めします。 人間とマシンのコラボレーションの境界: 自動ラベル付け結果に対して手動レビューを設定することをお勧めします。20% の重複シナリオでも、話者のラベル付けエラーは依然として 5 ~ 10% に達する可能性があり、コンプライアンスに必要な会議記録は手動で確認する必要があります。

  • スマート スピーカーとホーム パーソナライゼーション: さまざまな家族の声を認識し、パーソナライズされたコンテンツの推奨を提供し、許可制御を操作します。 3D スピーカーの軽量モデル (CAM++、7.2M パラメーター) は、クラウド呼び出しを必要とせずに、スマート スピーカーのエンド側チップ上で実行できます。 コスト削減と効率の向上: クラウド ソリューションと比較して、オンデバイスの声紋認識では 1 回のインタラクションで 200 ~ 500 ミリ秒のネットワーク伝送遅延が節約され、クラウド推論コストはかかりません。 1 日あたり 50 回/1,000 万世帯ユーザーに基づくと、年間クラウド推論コストの削減は約 5,000 ~ 1 億元になります (1 回を 0.001 元として計算)。 検証の焦点: 家族の人数を 2 人から 6 人に増やした場合の認識の安定性。遠方界 (>2 メートル) および騒音環境 (台所の煙、テレビの背景音) での EER 劣化度。 3D スピーカーの事前トレーニング済みモデルは主に 16 kHz の近距離シーンを最適化し、遠距離フィールドは 3D スピーカー データセットの長距離サブセットを使用して微調整する必要があります。

  • コールセンター品質検査: 顧客サービスと顧客の間の会話セグメントを自動的に分離し、顧客サービスの話速、感情、サービス条件に関する品質検査分析を実行します。 検証の重要なポイント: 電話シナリオでのサンプリング レートの適応 (8kHz 対 16kHz)。顧客サービスと顧客の声が非常に類似している場合の分離精度。開始テンプレートとして 3D-Speaker の ECAPA-TDNN または ResNet34 モデル (CNCeleb 電話データのベンチマーク結果を含む) を使用することをお勧めします。

  • 公訴と法的証拠の収集: 証拠分析を支援するために、音声証拠内のさまざまな発言者を特定して分離します。 検証の焦点: 法的遵守要件に基づく解釈可能性 - スペクトル クラスタリング結果の分離境界が追跡可能である必要があります。 3D スピーカーの現在のクラスタリング プロセスでは詳細な信頼性出力が提供されないため、証拠収集プロセスで手動レビューを補足する必要があります。このシナリオは、話者の数に関する事前の知識に大きく依存します (ほとんどのクラスタリング アルゴリズムでは、話者の数を事前に設定するか、複雑な推定器を使用する必要があります)。ステージ 2 では、アフィニティ伝播などの自動推定クラスタリング アルゴリズムを使用することをお勧めします。

該当する 3D スピーカーのグループ

3D-Speaker はプロレベルのオープンソース ツールとして位置付けられており、そのユーザー プロファイルは一般のエンド消費者ではなく、音声技術分野の開発者や研究者に焦点を当てています。

  • 音声テクノロジー開発者およびインテグレーター: 声紋認識機能を製品に統合する必要がある技術チーム。 Pipeline を使用することをお勧めします。ModelScope を直接使用して、自分でトレーニングすることなく、事前トレーニングされたモデルを推論用にロードします。一般的な統合サイクルは約 2 ~ 4 週間です (モデルの検証と API パッケージ化を含む)。 境界には適していません: Python/Shell プログラミングと深層学習の基盤に対する明確な要件があり、AI エンジニアリングの経験のないフロントエンドまたはフルスタックの開発者には適していません。純粋な HTTP API 呼び出しが必要で、自己展開を受け入れない場合は、商用の声紋認識 API を評価する必要があります。

  • AI 研究者 (話者認識方向): 声紋認識、音声生体認証、自己教師あり表現学習に従事する研究者。 3D-Speaker は、3D-Speaker、VoxCeleb、または CNCeleb データセットで SOTA 結果を迅速に再現するためのトレーニング レシピとベンチマークの完全なセットを提供します。 前提条件: PyTorch とディープ ラーニング トレーニング プロセスに精通していること。自分のプライベート データの事前トレーニングには、RDINO または SDPN 自己監視スキームを使用することをお勧めします。

  • 財務/セキュリティ テクノロジー チーム: ID 認証またはオーディオ フォレンジックのシナリオで声紋検証機能を必要とするエンタープライズ チーム。推奨されるパス: まず、事前トレーニングされたモデルを使用してターゲット シーン データ (特定のマイク、周囲ノイズ) に対して POC を実行し、精度要件が満たされていることを確認してから、実稼働環境の統合に組み込みます。 不適合な境界: 完全な生体検出 (アンチスプーフィング) 機能を必要とするシナリオは、3D スピーカー自体では提供されず、ASVspoof または他のアンチスプーフィング エンジンを追加で統合する必要があります。

  • スマート ハードウェアおよび IoT チーム: エンドサイドの声紋認識をスマート スピーカー、ウェアラブル デバイス、車両システムに導入します。 CAM++ モデルは、7.2M パラメータという軽量の利点を備え、リソースに制約のあるエッジ デバイスに適しています。 前提条件: モデルの定量化と ONNX/TensorRT のデプロイメントの経験が必要です。

  • 会議システムおよびコラボレーション ツールの開発者: 会議製品のエクスペリエンスを向上させるために自動発言者ログ機能を必要としているチーム。ダイアライゼーション レシピから開始し、事前トレーニングされたモデル + スペクトル クラスタリングを使用して POC を完了することをお勧めします。 不適切な境界: 非常に高いリアルタイム要件 (遅延 <500ms) を伴うストリーミング シナリオ - 現在のダイアライゼーション パイプラインはクラスタリングを実行するために完全なオーディオを必要とするため、フレームごとの出力ストリーミング処理には適していません。ストリーミング ソリューションが必要な場合は、クラスタリング アルゴリズムをオンライン バージョンに変更する必要があります。

グローバル不適合境界の概要: 3D スピーカーは、ASR (音声テキスト変換)、TTS (音声合成)、または NLU (自然言語理解) 機能を提供しないため、完全な音声対話システムを構築するには、他の音声モジュールと組み合わせる必要があります。 8kHz 電話チャネル、強い背景雑音 (信号対雑音比 <10dB)、子供や高齢者の話者などのロングテール シナリオでの認識性能は、ターゲット データの実測によって検証する必要があります。 GPU オフライン推論が使用されていない場合、CPU ONNX 推論のレイテンシーは数百ミリ秒に達する可能性があり、同時実行性の高いリアルタイム シナリオには適していません。

概要と展望

3D-Speaker は、中国の声紋認識オープンソース コミュニティに「データセット + ツールキット」統合というユニークな生態学的ニッチを確立しました。pyannote.audio (研究ベースの日記作成に焦点を当てている) や WeSpeaker (話者認識ベースラインに焦点を当てている) とは異なり、3D-Speaker の焦点は、大規模な多次元データ セットから再現可能な工業グレードのベンチマークへの完全なリンクを提供することです。その核となる価値は 3 つの文に要約できます。1 つは 3D スピーカー データ セットを使用して、中国語のマルチデバイス/マルチ距離/マルチ方言の声紋データのギャップを埋めることです。 ERes2NetV2 や CAM++ などのモデルを使用して、複数のベンチマークで EER レコードを継続的に更新します。 Apache 2.0 オープン ソース プロトコルを使用して、声紋認識技術の商業的敷居を下げます。

現在の主な制限事項: まず、GitHub リポジトリには正式なリリース番号とセマンティック バージョン番号がありません。ユーザーがバージョン番号を通じてコードの安定性を評価したり、コードの範囲を変更したりすることは困難です。実稼働ユーザーは特定のコミットをロックする必要があります。第 2 に、事前トレーニング モデルは主に 16 kHz サンプリング レートの中国語と英語のシナリオを対象としており、8 kHz の電話音声と低リソース言語のカバー範囲は限られています。 3 番目に、スプーフィング防止機能が提供されていないため、追加の生存検出ソリューションを財務レベルの ID 認証シナリオに統合する必要があります。第 4 に、ドキュメントは主に中国語で書かれており (README は英語です)、国際コミュニティの構築はまだ初期段階にあり、英語の技術ブログやチュートリアル リソースはほとんどありません。 5 番目に、公式の Docker イメージと CI ビルド ステータスの識別が存在せず、コンテキストの一貫性の問題をユーザーが自分で解決する必要があります。

その後の進化の方向: GitHub の活動 (2026 年 7 月の時点でも新しいコミットがあります) と ICASSP 2025 論文の受理から判断すると、3D スピーカー チームはまだ投資を続けています。注目に値する進化の方向性には、クライアント側推論のさらなる最適化 (TFLite/CoreML エクスポートの開始の可能性)、ストリーミング ダイアライゼーションのサポート (現在はオフライン クラスタリングのみをサポート)、より低リソースの言語向けの複数方言拡張、および ModelScope エコシステムとのより深い統合 (AutoML 自動パラメータ チューニングなど) が含まれます。

調達および採用のリスク評価: Apache 2.0 オープンソース プロジェクトである 3D-Speaker には、認証リスクやベンダー ロックインのリスクがなく、声紋認識機能のエントリーレベルの検証およびプロトタイプ開発プラットフォームとして適しています。エンタープライズ統合では、「3 段階の方法」を採用する必要があります。最初 (2 ~ 4 週間): 事前トレーニングされたモデルを使用してターゲット シーン データ (ターゲット マイク、周囲ノイズ サンプル、ターゲット スピーカー サイズ) に対して POC を実行し、EER がビジネスのしきい値を満たしているかどうかを検証します。 2 番目 (4 ~ 8 週間): POC が基準を満たしている場合、分離環境 (非実稼働) で ONNX エクスポートと API パッケージ化を完了し、既存の ASR/NLP パイプラインと統合します。 3 番目 (継続的): グレースケールがオンラインになった後の環境の本番環境の EER ドリフト (新規登録ユーザーや新しいシナリオによって引き起こされる配布の変化など) を監視し、GitHub コミットの更新頻度に注意を払います。6 か月以上アクティブなコミットがない場合は、選択する必要がある代替ツールがあるかどうかを評価する必要があります。コンプライアンスに敏感な業界 (金融、セキュリティ) で使用する前に、ModelScope プラットフォーム モデルの重み付け (Apache 2.0 とは異なる場合があります) の使用条件と、商用二次的著作物に対するデータ セットの CC BY-SA 4.0 契約の適用可能性を確認する必要があります。

関連ツール: elevenlabs、udio

バージョン情報

  • ダイアライゼーション ベンチマークの更新 :Aishell-4、Alimeeting、AMI、VoxConverse などの複数の公開データセットで再現可能な DER ベンチマーク結果を提供するために、スピーカー ログ (ダイアライゼーション) レシピを更新しました。正式な正確な日付はまだありません。
  • ERes2NetV2 リリース :200,000 話者データセットに基づいてトレーニングされた ERes2NetV2 および ERes2NetV2_w24s4ep4 事前トレーニング モデルをリリースしました。パラメーターが少なく、推論が高速化されています。公式の正確な日付はまだありません。
  • マルチモーダルおよび SSL の拡張 :SDPN 自己教師ありモデル X ベクトル トレーニング レシピ、ビジュアル モジュール (TalkNet) およびセマンティック モジュール (BERT) トレーニング レシピをリリースしました。公式の正確な日付はまだありません。
  • ONNX ランタイムと ERes2NetV2 VoxCeleb :ONNX Runtime 推論ランタイムをリリースしました。 VoxCeleb データセットに基づいた ERes2NetV2 モデルをリリースしました。公式の正確な日付はまだありません。
  • 言語IDとマルチモーダルダイアライゼーション :音素情報を融合した言語認識式を公開。音声と映像を融合したマルチモーダルスピーカーログ公式を公開。公式の正確な日付はまだありません。
  • ResNet および Res2Net レシピ :3D-Speaker、VoxCeleb、および CN-Celeb データセット上の ResNet34 および Res2Net のトレーニングおよび推論レシピをリリースします。利益率の高いファインチューンレシピを公開。公式の正確な日付はまだありません。
  • ERes2Net-Base 事前トレーニング済み :200,000 話者の中国語データセットでトレーニングされた、ERes2Net ベースの事前トレーニング済みモデルをリリースしました。公式の正確な日付はまだありません。
  • コアモデルの発売 :CAM++、ERes2Net-Base、ERes2Net-Large の事前トレーニング モデルをリリースしました。対話検出モジュールとセマンティック話者切り替え検出モジュールをリリースしました。公式の正確な日付はまだありません。
  • データセットと初期リリース :3D スピーカー データ セットとベースライン モデル、ERes2Net、CAM++、RDINO などのベンチマークを正式にリリースしました。公式の正確な日付はまだありません。

ユーザーレビュー

  • レビューを読み込み中...