Haut-parleur 3D Gratuit

-

3D-Speaker est la boîte à outils open source d'Alibaba Cloud ModelScope pour la vérification des locuteurs simples/multimodaux, l'identification des locuteurs et la séparation des journaux des locuteurs. Il fournit des modèles pré-entraînés tels que ERes2Net, CAM++ et ECAPA-TDNN ainsi que des ensembles de données vocales 3D à grande échelle, et prend en charge les journaux de locuteurs multimodaux qui intègrent la parole et la vision.

Haut-parleur 3D Interface du produit

Haut-parleur 3D

Paramètres et statistiques de base de 3D-Speaker

3D-Speaker est une boîte à outils open source de vérification, de reconnaissance et de séparation des journaux de haut-parleurs mono/multimodaux de la communauté Alibaba Cloud ModelScope. Il fournit une chaîne d'outils complète depuis la formation de modèles jusqu'à l'inférence de production pour les développeurs de technologies vocales et les chercheurs en IA. Le « 3D » dans son nom représente les trois dimensions de l'ensemble de données : multi-appareils, multi-distances et multi-dialectes, plutôt qu'une vision tridimensionnelle.

Projets Informations publiques
Positionnement du produit Boîte à outils open source de vérification de locuteurs simples/multimodaux et de séparation des journaux
Pile technologique de base Apprentissage profond (ResNet, Res2Net, ECAPA-TDNN, ERes2Net, CAM++, SDPN, etc.)
Nombre de modèles pré-entraînés 10+ (couvrant la vérification du locuteur, l'identification de la langue, l'apprentissage auto-supervisé)
Contrat de licence Licence Apache 2.0
Plateformes prises en charge Linux, macOS, ordinateur de bureau, API
Langages de programmation Python (54 %), Shell (27 %), Perl (15 %), C++ (3 %)
Étoiles GitHub ~3 100
Fourches GitHub ~267
Contributeurs 8 personnes (à partir de 2026-07)
Organisation affiliée Académie Alibaba DAMO / ModelScope
Lieu d'appartenance CN
Ensemble de données lié Ensemble de données de haut-parleurs 3D (plus de 10 000 haut-parleurs, 190 Go de données d'entraînement)
Documents académiques Acceptation ICASSP 2025

Brève revue en une phrase : 3D-Speaker n'est pas un produit d'assistant vocal, mais une bibliothèque d'outils open source de reconnaissance d'empreintes vocales professionnelle produite par ModelScope - permettant aux développeurs de créer des capacités de niveau production pour "identifier les personnes en écoutant des voix" à faible coût, et de fournir un ensemble de données de référence à grande échelle pour y correspondre.

Limite des capacités de base : 3D-Speaker se concentre sur la tâche de "qui parle" et ne fournit pas de compréhension sémantique ASR (parole en texte), TTS (synthèse vocale) ou PNL. Il résout le problème de reconnaissance d'identité dans le pipeline d'interaction vocale et doit être combiné avec d'autres modules vocaux pour former un système de dialogue complet.

Reconnaissance des utilisateurs et du marché de 3D-Speaker

La technologie de reconnaissance d'empreintes vocales se trouve à une étape critique de la transition de la recherche universitaire vers des applications industrielles à grande échelle : la demande d'« identification des personnes en écoutant leurs voix » continue de croître dans des scénarios tels que l'authentification de l'identité financière, l'analyse intelligente des conférences et la personnalisation de la maison intelligente. Cependant, le manque de chaînes d’outils open source de haute qualité a longtemps limité la rapidité de la mise en œuvre industrielle. Dans ce contexte, 3D-Speaker s'appuie sur l'écosystème ModelScope (plateforme open source d'IA d'Alibaba Cloud) et est devenu l'un des projets open source les plus influents dans le domaine de la reconnaissance des locuteurs chinois.

Reconnaissance de la communauté : le référentiel GitHub a reçu environ 3 100 étoiles et 267 forks. Comparé à des projets open source similaires (tels que WeSpeaker avec environ 4,5 000 étoiles, SpeechBrain avec environ 9 000 étoiles), 3D-Speaker est reconnu au premier échelon de la communauté chinoise des technologies vocales. La principale différence est qu'il fournit une solution intégrée « données + code » d'ensembles de données multi-appareils/multi-distances/multi-dialectes à grande échelle et un ensemble complet de modèles de base.

Impact académique : les articles liés à 3D-Speaker ont été acceptés par ICASSP 2025 (la plus grande conférence universitaire dans le domaine de la parole), et l'article est intitulé "3D-Speaker-Toolkit : une boîte à outils Open Source pour la vérification et la diarisation des locuteurs multimodaux". L'article sur l'ensemble de données 3D-Speaker qui l'accompagne (arXiv 2306.15354) fournit une référence à grande échelle de plus de 10 000 locuteurs dans 14 dialectes chinois pour la recherche sur le découplage de la représentation vocale, et a été cité par de nombreux chercheurs.

Adoption industrielle : la reconnaissance d'empreintes vocales est l'une des technologies clés pour « l'authentification améliorée de l'identité » dans les scénarios de conformité financière. S'appuyant sur l'écosystème Alibaba Cloud, 3D-Speaker couvre les utilisateurs développeurs dans les domaines de la finance, de la sécurité, des conférences et d'autres secteurs grâce au téléchargement de modèles pré-entraînés et aux services d'inférence en ligne de la plateforme ModelScope. Les données d'adoption spécifiques au niveau de l'entreprise ne sont pas publiques, mais les téléchargements de la page du modèle de vérification des locuteurs de la plateforme ModelScope peuvent être utilisés comme référence indirecte.

Positionnement différentiel par rapport aux produits concurrents : par rapport aux outils grand public internationaux tels que pyannote.audio (développé par une équipe française, axé sur la diarisation), SpeechBrain (boîte à outils vocale complète) et WeSpeaker (axé sur la reconnaissance du locuteur), 3D-Speaker. Les principaux avantages résident en trois points : premièrement, il fournit un ensemble de données multidialectes chinois à grande échelle (3D-Speaker-Dataset) ; deuxièmement, il couvre à la fois les solutions monomodales (audio pur) et multimodales (fusion audio et vidéo) ; troisièmement, il continue de maintenir des résultats de référence de premier plan dans des architectures de modèles telles que ERes2NetV2 et CAM++.

Avantage financier du 3D-Speaker

Le modèle tarifaire de 3D-Speaker est extrêmement simple – entièrement gratuit sous la licence open source Apache 2.0. Mais la structure réelle des coûts derrière « open source et gratuit » doit être ventilée par rôle :

Client C/développeur individuel : le code et le modèle pré-entraîné sont entièrement gratuits à télécharger et à utiliser (licence Apache 2.0). Les développeurs individuels peuvent exécuter l'inférence sur des GPU natifs (tels que RTX 3090/4090) sans aucun frais de licence. L'ensemble de données 3D-Speaker (~ 190 Go) est également disponible gratuitement, mais le téléchargement nécessite de la bande passante et du temps.

API/Développeur : Pas de tarification officielle de l'API hébergée - 3D-Speaker ne propose pas d'API payante autonome sur la plateforme ModelScope (contrairement au modèle d'API commercial pour les modèles de base tels que l'API DeepSeek). Les développeurs peuvent choisir :

  • Mode d'auto-déploiement : exécutez l'inférence sur votre propre serveur, et le coût dépend entièrement de l'investissement matériel. L'inférence de vérification d'un seul locuteur peut être réalisée en quelques dizaines de millisecondes sur des GPU grand public, et le goulot d'étranglement du débit réside principalement dans les étapes de détection d'activité vocale (VAD) et de décodage audio avant l'extraction des fonctionnalités.
  • Inférence en ligne ModelScope : la plate-forme ModelScope fournit des services d'expérience en ligne pour certains modèles pré-entraînés, mais elle est principalement utilisée pour la vérification fonctionnelle et n'est pas adaptée aux scénarios de production à haute concurrence. La limite d'utilisation spécifique est soumise à la page officielle ModelScope.

Entreprise/Privé : la licence Apache 2.0 permet une utilisation commerciale, une modification et une redistribution gratuites sans frais de licence. Toutefois, les entreprises doivent supporter les investissements explicites suivants :

  • Infrastructure GPU : une seule carte A100-80G peut effectuer l'inférence par lots de modèles grand public tels que ERes2NetV2 (17,8 M de paramètres) ; les tâches de diarisation à grande échelle (telles que des dizaines d'heures d'audio de conférence) nécessitent des configurations de ressources CPU/GPU de spécifications plus élevées.
  • Collecte et annotation de données : les performances réelles du système de reconnaissance d'empreintes vocales dépendent fortement des données qui correspondent à la scène cible. La précision de la reconnaissance entre les appareils (par exemple, le passage d'un microphone d'ordinateur à un canal téléphonique) et à travers les distances (champ proche ou champ lointain) diminuera considérablement. Les entreprises doivent généralement collecter en plus des données vocales de la scène cible et effectuer un réglage fin du domaine. Ce coût implicite dépasse souvent le coût d'utilisation du modèle lui-même.
  • Investissement dans l'intégration du système : le module de reconnaissance d'empreintes vocales doit être connecté aux pipelines ASR, VAD, NLP et autres existants, ce qui implique un investissement en main-d'œuvre en ingénierie.

Comparaison des coûts : outils open source et API commerciales :

Éléments de coûts 3D-Speaker (open source et auto-déploiement) API d'empreinte vocale commerciale (telle que la reconnaissance d'empreinte vocale Alibaba Cloud)
Frais de licence Zéro Facturé au volume d'appels
Serveur GPU (estimation mensuelle) 5 000 à 50 000 yuans (selon l'échelle) Zéro (appel API)
Main d'œuvre d'exploitation et de maintenance Maintenance par un ingénieur requise Zéro
Mise au point de l'adaptation scénique Auto-investissement La personnalisation n'est généralement pas prise en charge
Confidentialité des données Entièrement localisé Dépendance aux fournisseurs de services cloud
Coût marginal après barème Proche de zéro (uniquement le coût de l'électricité) Croissance linéaire avec le volume d'appels

Conseil sur les coûts cachés : l'EER de 3D-Speaker peut être aussi bas que 0,52 % sur des ensembles de tests standards tels que VoxCeleb et CNCeleb, mais ces chiffres sont obtenus dans des conditions de laboratoire contrôlées. Dans des scénarios réels (situations non silencieuses, appels téléphoniques, enfants ou personnes âgées), la précision de la reconnaissance diminue considérablement. Avant de mettre le modèle en production, vous devez effectuer des tests en niveaux de gris sur les données de la scène cible pendant au moins deux semaines pour comparer l'écart de performances entre le modèle pré-entraîné et le modèle affiné.

Principales fonctions du 3D-Speaker

Les principales capacités de 3D-Speaker tournent autour de la tâche « identifier l'identité du locuteur à partir de la parole » et impliquent quatre modules fonctionnels interdépendants :

  • Speaker Verification : authentification d'identité 1:1, vérifiant si un discours appartient à un locuteur déclaré. Il s'agit d'un scénario de base pour la vérification de l'identité financière et la connexion au système. 3D-Speaker propose plusieurs modèles tels que ERes2NetV2, CAM++, ECAPA-TDNN, etc., et l'EER sur l'ensemble de test VoxCeleb varie de 0,52 % (ERes2Net-Large) à 1,56 % (Res2Net). Problèmes de mise en œuvre : la sélection du seuil de vérification compromet directement la sécurité et l'expérience utilisateur : si le seuil est trop strict, il améliorera la sécurité mais augmentera le taux de rejet des utilisateurs. Il est recommandé d'effectuer une analyse de la courbe ROC en fonction du niveau de sécurité de l'entreprise à déterminer.

  • Identification du haut-parleur : correspondance d'identité 1:N, identifiant à quelle identité connue appartient la voix actuelle à partir de l'ensemble de haut-parleurs enregistrés. Il convient à des scénarios tels que les enquêtes suspectes et l'identification automatique des clients VIP. Problèmes de mise en œuvre : lorsque la taille de l'ensemble d'enregistrement augmente, la précision de la reconnaissance diminue. Dans les scénarios à grande échelle (> 10 000 personnes), il est recommandé d'introduire une indexation hiérarchique ou une accélération ANN.

  • Diarisation du haut-parleur : divisez et étiquetez l'audio de plusieurs personnes en fonction de "qui a parlé à quelle heure", et horodatage de sortie + étiquette du haut-parleur. Il s’agit de la capacité préalable essentielle à l’analyse des réunions et à l’inspection de la qualité du service client. Le pipeline de diarisation de 3D-Speaker contient cinq modules enfichables : Détection de parole superposée (en option) → Détection d'activité vocale → Segmentation de la parole → Extraction d'intégration de haut-parleurs → Regroupement de haut-parleurs. Sur l'ensemble de données Aishell-4, le DER (Diarisation Error Rate) peut atteindre 10,30 %. Problèmes de mise en œuvre : La détection de chevauchement est le goulot d'étranglement du projet actuel : lorsque deux personnes ou plus parlent en même temps, le schéma de diarisation traditionnel attribuera incorrectement la zone de chevauchement à l'un des locuteurs ou la marquera comme du bruit, provoquant une perte d'informations. 3D-Speaker fournit un module de détection de chevauchement en option pour atténuer ce problème.

  • Identification de la langue : identifiez le type de langue du discours (actuellement en se concentrant sur le chinois et l'anglais). Sur la base du modèle CAM++, un EER de 29,36 % est obtenu sur l'ensemble de données 3D-Speaker (la reconnaissance linguistique est principalement basée sur la précision, cet EER est uniquement à titre de référence). Convient aux scénarios de routage automatique des centres d'appels multilingues.

  • Diarisation multimodale des haut-parleurs : Fusion de l'entrée d'image audio et vidéo. Les caractéristiques du mouvement des lèvres et de l'activité faciale sont extraites des vidéos via le modèle TalkNet-ASD, et l'inférence conjointe avec les caractéristiques audio est nettement meilleure que la solution audio uniquement dans les scénarios de parole superposée. Il convient aux scénarios tels que les vidéoconférences et les enregistrements d'entretiens contenant à la fois des données audio et vidéo.

  • Vérification auto-supervisée du locuteur (Self-Supervised SV) : fournit deux solutions de formation auto-supervisées, RDINO et SDPN, qui peuvent apprendre la représentation du locuteur sur des données vocales non étiquetées, réduisant ainsi la dépendance à l'égard de données annotées de haute qualité. Convient aux scénarios de pré-entraînement sur des données vocales non étiquetées à grande échelle.

[Vue d'expert : Synergie fonctionnelle] : Ces quatre fonctions forment un pipeline de traitement complet « parole → balise de locuteur » - La diarisation sépare les segments de parole des différents locuteurs → La vérification/identification étiquette chaque segment avec une identité → L'identification de la langue complète les méta-informations de la langue. Dans le déploiement technique réel, la précision de la segmentation de la diarisation (en particulier la qualité de la segmentation vocale superposée) constitue le goulot d'étranglement de l'ensemble du pipeline : les erreurs de segmentation seront directement transmises aux sections de vérification, entraînant des erreurs d'annotation d'identité. Il est recommandé d'investir davantage de ressources de réglage dans le VAD et la segmentation du pipeline, plutôt que de se concentrer uniquement sur la précision du modèle de vérification lui-même.

Evolution du modèle et de la version de 3D-Speaker

3D-Speaker est continuellement mis à jour en mode « l'itération des fonctions entraîne l'évolution de la version ». Le référentiel GitHub n'a pas de numéros de version sémantiques traditionnels (pas de versions v1.0, v2.0, etc.), mais est promu sous la forme de « versions mensuelles/trimestrielles de nouveaux modèles ou de nouvelles fonctions ». Ce qui suit est une reconstruction du contexte de la version basée sur la chronologie des nouveautés dans le README :

Phase 1 : publication de l'ensemble de données et du modèle de référence (2023.06 - 2023.11)

  • 2023.06 : L'ensemble de données 3D-Speaker est officiellement publié, comprenant plus de 10 000 locuteurs dans 14 dialectes chinois, des étiquettes multi-appareils (PC, enregistreur, baie, iPad mobile) et multi-distances (0,1 m à 4 m). Dans le même temps, des modèles de base et des tests de référence tels que ERes2Net, CAM++ et RDINO ont été publiés.
  • 2023.07 : les modèles de pré-formation CAM++, ERes2Net-Base et ERes2Net-Large sont lancés sur la plateforme ModelScope ; Des modules de détection de dialogue et de détection de changement de locuteur sémantique sont lancés pour améliorer la dimension sémantique de la diarisation.
  • 2023.08 : publication des résultats de référence CAM++, ERes2Net-Base et ERes2Net-Large sur l'ensemble de données CN-Celeb ; a publié des modèles de reconnaissance des langues chinoise et anglaise.
  • 2023.09 : Publication de recettes de formation et d'inférence pour le modèle de vérification de locuteur auto-supervisé RDINO sur l'ensemble de données CN-Celeb.
  • 2023.10 : Publication des recettes de formation et d'inférence d'ECAPA-TDNN sur trois jeux de données (3D-Speaker, VoxCeleb, CN-Celeb).
  • 2023.11 : publication du modèle pré-entraîné basé sur ERes2Net, formé sur la base d'un ensemble de données de 200 000 locuteurs chinois mandarin.

Phase 2 : Expansion du système modèle (2024.01 - 2024.08)

  • 2024.01 : publication des recettes de modèles ResNet34 et Res2Net, couvrant trois ensembles de données ; a publié des recettes de réglage fin à grande marge et des recettes d'inférence de diarisation.
  • 2024.02 : publication d'une recette de reconnaissance linguistique qui intègre des informations phonémiques pour améliorer la précision de la reconnaissance linguistique ; a publié une recette de diarisation multimodale pour intégrer les entrées audio et vidéo.
  • 2024.04 : lancement du runtime d'inférence ONNX Runtime, qui prend en charge l'exportation de modèles au format ONNX et une inférence efficace sur les appareils CPU/Edge ; a publié le modèle ERes2NetV2 avec moins de paramètres et une inférence plus rapide sur VoxCeleb.
  • 2024.05 : publication de recettes de formation et d'inférence de modèles vectoriels X auto-supervisés SDPN ; a publié des recettes de module de vision (TalkNet-ASD) et de module sémantique (BERT) pour étendre les capacités de perception multimodale du locuteur.
  • 2024.08 : publication des modèles pré-entraînés ERes2NetV2 et ERes2NetV2_w24s4ep4, entraînés sur un ensemble de données de haut-parleurs de 200 000 pour obtenir un meilleur équilibre entre l'EER et la taille des paramètres.

La troisième phase : Ingénierie et amélioration du benchmark (2024.12)

  • 2024.12 : recette de diarisation entièrement mise à jour pour fournir des références DER reproductibles sur plusieurs ensembles de données publics multi-locuteurs tels que Aishell-4, Alimeeting, AMI, VoxConverse, Meeting-CN, etc. Il s'agit de la dernière version majeure et marque la transformation de 3D-Speaker d'un pur outil de recherche à une référence d'ingénierie reproductible.

Déclaration de politique de version : 3D-Speaker ne suit pas le numéro de version sémantique et il n'y a pas d'enregistrement de version officiel sur la page des versions de GitHub. Les utilisateurs doivent prêter attention à la page du modèle ModelScope de l'historique Git Commit et au journal de mise à jour README pour suivre les dernières modifications. Cette méthode de publication réduit les coûts de maintenance, mais elle rend également difficile pour les utilisateurs de juger de la stabilité du code à travers un seul numéro de version - il est recommandé de verrouiller des validations spécifiques pour une utilisation en production.

Avantages techniques du 3D-Speaker

L'avantage technique de 3D-Speaker réside non seulement dans la percée d'une certaine architecture de modèle, mais également dans la couverture complète des liens depuis les données jusqu'au modèle, de la formation au déploiement. Ce qui suit est démantelé des deux dimensions de l’innovation architecturale et de l’ingénierie.

Pedigree d'architecture de modèle : 3D-Speaker intègre plus de 8 architectures de modèles de vérification de locuteurs, couvrant différentes échelles et scénarios d'application :

Modèle Paramètres VoxCeleb EER CNCeleb EER 3DSpeaker EER Caractéristiques
Res2Net 4,03 millions 1,56% 7,96% 8,03% Ligne de base légère
ResNet34 6,34 millions 1,05% 6,92% 7,29% Architecture classique
ECAPA-TDNN 20,8 millions 0,86% 8,01% 8,87% Base de référence compétitive
ERes2Net-base 6,61 millions 0,84% 6,69% ​​ 7,21% Performance à coût élevé
CAM++ 7,2 millions 0,65% 6,78% 7,75% Convolution efficace
ERes2NetV2 17,8 millions 0,61% 6,14% 6,52% Recommandation de haute précision
ERes2Net-large 22,46 millions 0,52% 6,17% 6,34% Précision la plus élevée

Chaîne causale de mécanisme → effet → scène : le cœur technique de la vérification du locuteur consiste à extraire « l'intégration discriminante du locuteur » de dimension fixe (Speaker Embedding) à partir d'un discours de longueur variable. ERes2NetV2 intègre des fonctionnalités temps-fréquence multi-échelles grâce à la conception hiérarchique des connexions résiduelles, réduisant le nombre de paramètres de 14 % tout en réduisant l'EER de 0,84 % (ERes2Net-base) à 0,61 %. Cela signifie que dans les scénarios où le taux d'erreur est proche de zéro (comme le contrôle des risques financiers), ERes2NetV2 peut atteindre le même seuil de sécurité à un coût de calcul inférieur. Ses scénarios applicables sont des environnements de production qui nécessitent une vérification de haute précision des locuteurs et sont sensibles aux retards d'inférence.

Avantages innovants de CAM++ : CAM++ (Contextual Attention Module) est une architecture convolutive efficace proposée par l'équipe 3D-Speaker. Il atteint 0,65% EER sur VoxCeleb avec un montant de paramètres extrêmement faible de 7,2M, se rapprochant du niveau d'ERes2NetV2 (17,8M). L’efficacité des paramètres (rapport EER/quantité de paramètres) est la plus élevée de tous les modèles. Pour les scénarios de reconnaissance d'empreintes vocales qui doivent être déployés sur des appareils ou des appareils mobiles, CAM++ est l'évaluation prioritaire la plus digne d'intérêt.

Ingénierie du pipeline de diarisation : la diarisation de 3D-Speaker adopte une conception de pipeline modulaire, et chaque étape peut être remplacée ou optimisée indépendamment :

  • Détection de parole superposée (basée sur le modèle d'étiquetage de séquence) → module optionnel pour identifier les zones dans lesquelles plusieurs personnes parlent en même temps
  • Détection d'activité vocale (VAD) → supprimer les clips silencieux et non vocaux
  • Segmentation du locuteur (basée sur BERT ou fenêtre fixe) → segmenter la parole en segments homogènes du locuteur
  • Extraction d'intégration de haut-parleurs → Utilisez des modèles tels que ERes2NetV2/CAM++ pour extraire les intégrations au niveau du segment
  • Clustering d'enceintes (clustering spectral/propagation d'affinité) → intégrations de clusters dans différentes enceintes

Sur les benchmarks Aishell-4 et Alimeeting, le pipeline a atteint des DER de 10,30 % et 19,73 %, respectivement, nettement meilleurs que la référence de Kaldi au cours de la même période (environ 12,2 % et 24,4 %, respectivement), vérifiant les avantages synergiques de la conception modulaire.

Mécanisme de fusion multimodale : la solution de diarisation de fusion audio et vidéo de 3D-Speaker extrait les caractéristiques de mouvement des lèvres et d'activité faciale de la vidéo via TalkNet-ASD, les fusionne avec les fonctionnalités audio au niveau de l'intégration, puis les envoie à un module de clustering unifié. Dans les scénarios avec une forte proportion de paroles superposées, les informations visuelles fournissent un signal de limite de commutation de locuteur là où l'audio est manquant, réduisant ainsi le DER d'environ 3 à 5 points de pourcentage. Les scénarios applicables incluent la vidéoconférence, les interviews en direct, les programmes d'information et d'autres domaines avec des données vidéo multi-caméras.

Optimisation du déploiement d'exécution ONNX : 3D-Speaker fournit des scripts d'exportation et d'inférence de modèles ONNX, prenant en charge la conversion de modèles formés par PyTorch au format ONNX et le déploiement sur des processeurs ou des appareils périphériques. Une fois le modèle optimisé quantitativement, la latence d'inférence peut être réduite de 1/3 à 1/2 des graphiques dynamiques PyTorch, et l'utilisation de la mémoire est réduite d'environ 40 %. Dans les environnements de serveur sans GPU, le déploiement ONNX constitue la voie la moins coûteuse pour introduire des capacités de reconnaissance d'empreinte vocale dans les environnements de production.

Limitations et limites d'adaptation : le modèle pré-entraîné de 3D-Speaker est principalement orienté vers les signaux vocaux avec un taux d'échantillonnage de 16 kHz (la parole téléphonique de 8 kHz nécessite une adaptation supplémentaire), et le modèle actuel fonctionne mieux dans les scènes chinoises et anglaises. Pour les scénarios avec de petits langages, des langages à très faibles ressources ou des taux d'échantillonnage non conventionnels, un schéma auto-supervisé (RDINO/SDPN) doit être utilisé pour pré-entraîner ou affiner les données cibles.

Comment utiliser 3D-Speaker

3D-Speaker propose deux chemins d'utilisation : l'exécution de code local et l'inférence en ligne de la plateforme ModelScope.

Chemin 1 : Exécuter le code de clonage local (recommandé aux développeurs)

# Cloner le dépôt
clone git https://github.com/modelscope/3D-Speaker.git
cd 3D-Haut-parleur

# Créer un contexte Python 3.8 et installer les dépendances
conda create -n Haut-parleur 3D python=3.8
conda active le haut-parleur 3D
pip install -r exigences.txt

Exemple de recette de formation (en prenant comme exemple la vérification du locuteur ERes2NetV2 sur l'ensemble de données 3D-Speaker) :

cd par exemple/3dspeaker/sv-eres2netv2/
bash run.sh

Utiliser un modèle pré-entraîné pour l'inférence : chargez le modèle pré-entraîné pour l'inférence via la bibliothèque ModelScope :

pip installer modelscope
# Inférence de vérification de locuteur à fichier unique
model_id = "iic/speech_eres2netv2_sv_zh-cn_16k-common"
python haut-parleur/bin/infer_sv.py --model_id $model_id

# Inférence par lots
python speakerlab/bin/infer_sv_batch.py --model_id $model_id --wavs wav_list.txt

# Inférence de modèle auto-supervisée (SDPN, basée sur la formation VoxCeleb)
model_id = "iic/speech_sdpn_ecapa_tdnn_sv_en_voxceleb_16k"
python haut-parleur/bin/infer_sv_ssl.py --model_id $model_id

Inférence du journal du locuteur (diarisation) :

# Diarisation audio pure
python speakerlab/bin/infer_diarization.py --wav audio.wav --out_dir ./output

# Activer la détection de la parole qui se chevauche (nécessite le jeton HuggingFace)
python speakerlab/bin/infer_diarization.py --wav audio.wav --out_dir ./output \
  --include_overlap --hf_access_token $hf_access_token

Chemin 2 : expérience en ligne ModelScope

Visitez la [page du modèle ModelScope Speaker Verification](https://www.modelscope.cn/models, page=1&tasks=speaker-verification&type=audio), sélectionnez le modèle pré-entraîné correspondant et téléchargez l'audio en ligne pour le tester. Convient pour une vérification rapide des capacités du modèle, mais ne convient pas pour l'intégration dans un contexte de production.

Troisième chemin : déploiement ONNX (inférence périphérique/CPU)

cd runtime/onnxruntime
# Reportez-vous à la documentation de ce répertoire pour exporter le modèle PyTorch vers ONNX et exécuter l'inférence

Liste des modèles pré-entraînés disponibles (tous distribués via ModelScope) :

ID du modèle Descriptif Ensemble de données
iic/speech_eres2net_sv_zh-cn_16k-common ERes2Net, 200 000 locuteurs Chinois mandarin
iic/speech_eres2netv2_sv_zh-cn_16k-common ERes2NetV2, 200 000 haut-parleurs Chinois mandarin
iic/speech_campplus_sv_zh-cn_16k-common CAM++, 200 000 haut-parleurs Chinois mandarin
iic/speech_sdpn_ecapa_tdnn_sv_en_voxceleb_16k Autosurveillance SDPN VoxCeleb (anglais)
iic/speech_campplus_lre_en-cn_16k Reconnaissance du langage CAM++ Chinois et anglais
iic/speech_eres2net_base_lre_en-cn_16k Identification de la langue ERes2Net Chinois et anglais

Téléchargement de l'ensemble de données 3D-Speaker :

# Ensemble de formation (~ 190 Go)
wget https://speech-lab-share-data.oss-cn-shanghai.aliyuncs.com/3D-Speaker/train.tar.gz
# Ensemble de tests (~ 1,1 Go)
wget https://speech-lab-share-data.oss-cn-shanghai.aliyuncs.com/3D-Speaker/test.tar.gz
# transcrire le texte
wget https://speech-lab-share-data.oss-cn-shanghai.aliyuncs.com/3D-Speaker/transcription.tar.gz

Conseils : 3D-Speaker n'a pas d'image Docker officielle et la documentation officielle est principalement un README chinois. Pour les utilisateurs de production, il est recommandé de verrouiller un Git Commit spécifique et de créer vous-même l'image Docker pour éviter un comportement incohérent provoqué par les changements de version des dépendances.

Prix des produits pour 3D-Speaker

3D-Speaker adopte le protocole open source Apache 2.0 et n'a aucun modèle de facturation commercial. Conditions spécifiques :

  • Portée d'utilisation : L'autorisation est accordée d'utiliser, copier, modifier, fusionner, distribuer, sous-licencier et/ou vendre librement des copies du logiciel.
  • Restrictions commerciales : Aucune - Le protocole Apache 2.0 est commercial et ne nécessite pas de travaux dérivés open source.
  • Exigences d'attribution : Conservez l'avis de droit d'auteur original et la liste des contributeurs dans les œuvres dérivées.
  • EXCLUSION DE GARANTIE : Aucune garantie, expresse ou implicite, n'est fournie lorsque cela est requis par la loi applicable ou convenu par écrit.
  • Licence de poids de modèle : les poids de modèle pré-entraînés sont hébergés sur la plate-forme ModelScope et leurs conditions d'utilisation sont soumises à la licence indiquée sur la page de la carte de modèle respective de ModelScope, qui peut être différente de l'accord Apache 2.0 du référentiel de code.
  • Licence d'ensemble de données : les métadonnées de l'ensemble de données 3D-Speaker sont publiées sous la licence CC BY-SA 4.0 et les droits d'auteur d'origine du contenu audio appartiennent au propriétaire des données d'origine.

Référence de prix : Zéro frais de licence. La formule de calcul du coût total de possession pour les utilisateurs d'entreprise est la suivante : « TCO = frais d'achat ou de location de GPU/serveur + main d'œuvre d'exploitation et de maintenance × nombre de mois + coût de collecte de données d'adaptation du scénario ». Pour les scénarios à moyenne échelle traitant moins de 1 000 heures d’audio par jour, le TCO de l’auto-déploiement est nettement inférieur à celui d’une API commerciale payante.

Scénarios d'application de 3D-Speaker

Les principaux moteurs du passage de la reconnaissance d'empreintes vocales du laboratoire à la mise en œuvre industrielle proviennent de trois directions : l'authentification de l'identité de conformité, l'intelligence de conférence et la personnalisation de la maison intelligente. Ce qui suit est une analyse basée sur un scénario basée sur les limites des capacités de 3D-Speaker.

  • Authentification de l'identité financière et prévention de la fraude : dans les scénarios de vérification d'identité à distance tels que les services bancaires par téléphone et le service client mobile, la vérification des empreintes vocales sert de complément ou d'alternative aux mots de passe/codes PIN. Le modèle de vérification du locuteur de 3D-Speaker peut être intégré aux systèmes IVR pour effectuer une comparaison d’identité dans les 3 à 5 premières secondes suivant l’appel d’un utilisateur. Réduction des coûts et amélioration de l'efficacité : avant l'introduction de la vérification des empreintes vocales, la réinitialisation du mot de passe du service client financier et la vérification de l'identité nécessitaient en moyenne 45 à 60 secondes de temps de traitement manuel ; après avoir intégré la vérification des empreintes vocales, la vérification d'identité de routine peut être effectuée automatiquement en 10 secondes (y compris la détection d'activité vocale + l'extraction de fonctionnalités + la comparaison), réduisant ainsi l'intervention manuelle d'environ 70 %. Points clés de vérification : précision de la reconnaissance sous le canal téléphonique (taux d'échantillonnage de 8 kHz), taux de rejet de l'authenticité dans les scénarios de voix courtes (<3 secondes) et capacités de défense de détection d'activité pour les enregistrements involontaires (enregistrements joués par des fraudeurs). 3D-Speaker lui-même ne fournit pas de module anti-usurpation d'identité et nécessite une intégration supplémentaire de solutions de détection en direct telles que ASVspoof.

  • Analyse des réunions et procès-verbaux intelligents : les enregistrements de réunions d'entreprise séparent automatiquement les clips vocaux des différents intervenants et se combinent avec l'ASR pour générer des procès-verbaux de réunion avec les étiquettes des intervenants. Le pipeline de diarisation de 3D-Speaker est au cœur de ce scénario. Réduction des coûts et amélioration de l'efficacité : Traditionnellement, il faut environ 2 à 3 heures pour compiler manuellement un procès-verbal d'une heure ; en utilisant la diarisation automatique + le pipeline ASR, le traitement audio d'une heure peut être effectué en 15 à 30 minutes et l'efficacité est augmentée de 4 à 10 fois (en fonction du temps d'inférence GPU). Objectif de vérification : Précision de la segmentation lorsque plusieurs personnes parlent en même temps (paroles superposées) - scénarios courants d'« interruption » et de « parole simultanée » dans les salles de conférence. La solution de diarisation traditionnelle marquera la zone de chevauchement comme étant le mauvais locuteur. La solution d'amélioration doit être atténuée par le module optionnel de détection de chevauchement de 3D-Speaker. Pour la visioconférence, il est recommandé d'activer la diarisation multimodale (fusion audio et vidéo) pour améliorer la robustesse de la reconnaissance des scènes qui se chevauchent. Limite de collaboration homme-machine : Il est recommandé de configurer un examen manuel pour les résultats d'étiquetage automatique : les erreurs d'étiquetage des locuteurs peuvent encore atteindre 5 à 10 % dans un scénario de chevauchement de 20 %, et les enregistrements de réunion requis pour la conformité doivent être confirmés manuellement.

  • Haut-parleurs intelligents et personnalisation de la maison : reconnaissez les voix des différents membres de la famille, fournissez des recommandations de contenu personnalisées et contrôlez les autorisations. Le modèle léger de 3D-Speaker (CAM++, 7,2 millions de paramètres) peut fonctionner sur la puce d'extrémité du haut-parleur intelligent sans avoir besoin d'appels cloud. Réduction des coûts et augmentation de l'efficacité : par rapport à la solution cloud, la reconnaissance d'empreinte vocale sur l'appareil permet d'économiser 200 à 500 ms de délai de transmission réseau pour une seule interaction, et il n'y a aucun coût d'inférence cloud. Sur la base de 50 fois par jour pour 10 millions d'utilisateurs domestiques, les économies annuelles sur les coûts d'inférence du cloud sont d'environ 50 à 100 millions de yuans (calculées sur la base d'une seule fois de 0,001 yuans). Objectif de vérification : Stabilité de la reconnaissance lorsque le nombre de membres de la famille passe de 2 à 6 ; Degré de dégradation EER en champ lointain (>2 mètres) et environnement sonore (fumée de cuisine, bruit de fond du téléviseur). Le modèle pré-entraîné du 3D-Speaker optimise principalement la scène en champ proche de 16 kHz, et le champ lointain doit être affiné à l'aide du sous-ensemble longue portée de l'ensemble de données 3D-Speaker.

  • Call Center Quality Inspection : séparez automatiquement les segments de dialogue entre le service client et les clients, et effectuez une analyse d'inspection qualité sur la vitesse de parole, l'émotion et les conditions de service du service client. Points clés de vérification : Adaptation du taux d'échantillonnage dans les scénarios téléphoniques (8 kHz vs 16 kHz) ; précision de séparation lorsque le service client et les voix des clients sont très similaires. Il est recommandé d'utiliser le modèle ECAPA-TDNN ou ResNet34 de 3D-Speaker (avec des résultats de référence sur les données téléphoniques CNCeleb) comme modèle de départ.

  • Poursuites publiques et collecte de preuves juridiques : identifiez et séparez les différents intervenants dans les preuves audio pour faciliter l'analyse des preuves. Objectif de vérification : interprétabilité conformément aux exigences de conformité légale – les limites de séparation des résultats de regroupement spectral doivent être traçables. Le processus de regroupement actuel de 3D-Speaker ne fournit pas de résultats de confiance détaillés, et un examen manuel doit être complété dans le processus de collecte de preuves. Ce scénario repose en grande partie sur la connaissance préalable du nombre de locuteurs (la plupart des algorithmes de clustering doivent prédéfinir le nombre de locuteurs ou utiliser des estimateurs complexes). Il est recommandé d'utiliser des algorithmes de clustering d'estimation automatique tels que la propagation par affinité à l'étape 2.

Groupes applicables de 3D-Speaker

3D-Speaker se positionne comme un outil open source de niveau professionnel et son profil d'utilisateur est axé sur les développeurs et les chercheurs dans le domaine de la technologie vocale, plutôt que sur les consommateurs finaux ordinaires.

  • Développeurs et intégrateurs de technologies vocales : équipes techniques qui doivent intégrer des capacités de reconnaissance d'empreintes vocales dans les produits. Il est recommandé d'utiliser Pipeline - utilisez directement ModelScope pour charger le modèle pré-entraîné pour l'inférence sans avoir à l'entraîner vous-même. Le cycle d'intégration typique dure environ 2 à 4 semaines (y compris la vérification du modèle et le packaging de l'API). Ne convient pas à la limite : il a des exigences claires en matière de programmation Python/Shell et de base d'apprentissage en profondeur, et ne convient pas aux développeurs front-end ou full-stack sans expérience en ingénierie de l'IA ; si vous avez besoin d'appels API HTTP purs et n'acceptez pas l'auto-déploiement, vous devez évaluer l'API commerciale de reconnaissance d'empreinte vocale.

  • Chercheur en IA (direction de reconnaissance du locuteur) : chercheurs engagés dans la reconnaissance d'empreintes vocales, la biométrie vocale et l'apprentissage des représentations auto-supervisé. 3D-Speaker fournit un ensemble complet de recettes de formation et de tests de référence pour reproduire rapidement les résultats SOTA sur les ensembles de données 3D-Speaker, VoxCeleb ou CNCeleb. Prérequis : Familier avec PyTorch et le processus de formation en deep learning. Il est recommandé d'utiliser les programmes auto-supervisés RDINO ou SDPN pour une pré-formation sur vos propres données privées.

  • Équipe technologique de finance/sécurité : équipes d'entreprise qui ont besoin de fonctionnalités de vérification d'empreinte vocale dans des scénarios d'authentification d'identité ou d'investigation audio. Chemin recommandé : utilisez d'abord le modèle pré-entraîné pour effectuer un POC sur les données de la scène cible (microphones spécifiques, bruit ambiant), vérifiez que les exigences de précision sont remplies, puis intégrez-le en production. Boundary Unfit : Les scénarios qui nécessitent des fonctions complètes de détection de corps vivants (anti-usurpation) ne sont pas fournis par 3D-Speaker lui-même, et ASVspoof ou d'autres moteurs anti-usurpation doivent être intégrés en plus.

  • Équipe Smart Hardware et IoT : Déployez la reconnaissance d'empreintes vocales de bout en bout dans les haut-parleurs intelligents, les appareils portables et les systèmes des véhicules. Le modèle CAM++ convient aux appareils périphériques aux ressources limitées avec l'avantage de légèreté de 7,2 millions de paramètres. Prérequis : Une expérience en quantification de modèles et en déploiement ONNX/TensorRT est requise.

  • Développeurs de systèmes de conférence et d'outils de collaboration : équipes qui ont besoin d'une fonctionnalité de journalisation automatique des intervenants pour améliorer leur expérience de produit de conférence. Il est recommandé de commencer par la recette de diarisation et d'utiliser le modèle pré-entraîné + le clustering spectral pour compléter le POC. Limite inappropriée : scénarios de streaming avec des exigences en temps réel extrêmement élevées (délai < 500 ms) : le pipeline de diarisation actuel nécessite un son complet pour effectuer le clustering et n'est pas adapté au traitement de streaming de sortie image par image. Si vous avez besoin d'une solution de streaming, vous devez modifier l'algorithme de clustering en une version en ligne.

Résumé des limites globales inadaptées : 3D-Speaker ne fournit pas de fonctionnalités ASR (parole en texte), TTS (synthèse vocale) ou NLU (compréhension du langage naturel), et doit être combiné avec d'autres modules vocaux pour créer un système d'interaction vocale complet. Les performances de reconnaissance dans des scénarios à longue traîne tels qu'un canal téléphonique de 8 kHz, un bruit de fond fort (rapport signal/bruit <10 dB), des haut-parleurs d'enfants ou de personnes âgées doivent être vérifiées par des mesures réelles sur les données cibles. Lorsque l'inférence GPU hors ligne n'est pas utilisée, la latence de l'inférence CPU ONNX peut atteindre des centaines de millisecondes, ce qui n'est pas adapté aux scénarios en temps réel à forte concurrence.

Résumé et Outlook

3D-Speaker a établi une niche écologique unique d'intégration « ensemble de données + boîte à outils » dans la communauté open source chinoise de reconnaissance d'empreintes vocales - contrairement à pyannote.audio (qui se concentre sur la diarisation basée sur la recherche) et à WeSpeaker (qui se concentre sur les bases de reconnaissance du locuteur), l'objectif de 3D-Speaker est de fournir un lien complet entre des ensembles de données multidimensionnelles à grande échelle et des références reproductibles de qualité industrielle. Sa valeur fondamentale peut être résumée en trois phrases : utiliser l'ensemble de données 3D-Speaker pour combler les lacunes des données d'empreinte vocale chinoises multi-appareils/multi-distances/multi-dialectes ; utiliser des modèles tels que ERes2NetV2 et CAM++ pour actualiser en permanence les enregistrements EER sur plusieurs benchmarks ; en utilisant le protocole open source Apache 2.0 pour abaisser le seuil commercial de la technologie de reconnaissance d'empreintes vocales.

Principales limitations actuelles : Premièrement, le référentiel GitHub n'a pas de numéros de version officiels et sémantiques. Il est difficile pour les utilisateurs d'évaluer la stabilité et de modifier la portée du code via le numéro de version. Les utilisateurs de production doivent verrouiller un commit spécifique. Deuxièmement, le modèle de pré-formation est principalement orienté vers des scénarios en chinois et en anglais avec un taux d'échantillonnage de 16 kHz, et a une couverture limitée de la parole téléphonique à 8 kHz et des langues à faibles ressources. Troisièmement, il ne fournit pas de capacités anti-usurpation d’identité et des solutions supplémentaires de détection d’activité doivent être intégrées dans les scénarios d’authentification d’identité au niveau financier. Quatrièmement, les documents sont principalement en chinois (README est en anglais), la construction d'une communauté internationale en est encore à ses débuts et il existe peu de blogs techniques et de ressources didactiques en anglais. Cinquièmement, il n'y a pas d'identification officielle de l'image Docker et de l'état de la construction CI, et les utilisateurs doivent résoudre eux-mêmes le problème de la cohérence du contexte.

Direction de l'évolution ultérieure : à en juger par l'activité de GitHub (il y a encore de nouveaux commits en 2026-07) et l'acceptation du papier ICASSP 2025, l'équipe 3D-Speaker continue d'investir. Les orientations d'évolution dignes d'attention incluent : une optimisation plus poussée du raisonnement côté client (lancement possible de l'exportation TFLite/CoreML), la prise en charge de la diarisation en streaming (ne prend actuellement en charge que le clustering hors ligne), des extensions multidialectes pour davantage de langages à faibles ressources et une intégration plus approfondie avec l'écosystème ModelScope (comme le réglage automatique des paramètres AutoML).

Évaluation des risques d'approvisionnement et d'adoption : en tant que projet open source Apache 2.0, 3D-Speaker ne présente aucun risque d'autorisation ni de risque de dépendance envers un fournisseur, et convient comme plate-forme de vérification et de développement de prototypes d'entrée de gamme pour les capacités de reconnaissance d'empreintes vocales. L'intégration d'entreprise doit adopter une « méthode en trois étapes » : premièrement (2 à 4 semaines) : utiliser le modèle pré-entraîné pour effectuer un POC sur les données de la scène cible (microphone cible, échantillon de bruit ambiant, taille du haut-parleur cible) afin de vérifier si l'EER atteint le seuil commercial ; deuxièmement (4 à 8 semaines) : si le POC répond aux normes, terminer l'exportation ONNX et le packaging de l'API dans l'environnement isolé (hors production) et intégrer au pipeline ASR/NLP existant ; Troisièmement (continu): surveillez la production de l'environnement après la mise en ligne des niveaux de gris, la dérive EER (comme les changements de distribution causés par des utilisateurs nouvellement enregistrés ou de nouveaux scénarios) et faites attention à la fréquence des mises à jour de GitHub Commit - s'il n'y a pas de commits actifs pendant plus de 6 mois, vous devez évaluer s'il existe des outils alternatifs qui doivent être sélectionnés. Avant toute utilisation dans des secteurs sensibles à la conformité (finance, sécurité), vous devez confirmer les conditions d'utilisation des pondérations des modèles de la plateforme ModelScope (qui peuvent être différentes de celles d'Apache 2.0) et l'applicabilité de l'accord CC BY-SA 4.0 de l'ensemble de données aux œuvres dérivées commerciales.

Outils associés : , udio

Informations de version

  • Mise à jour du benchmark de diarisation :Mise à jour de la recette du journal des locuteurs (Diarisation) pour fournir des résultats de référence DER reproductibles sur plusieurs ensembles de données publics tels que Aishell-4, Alimeeting, AMI, VoxConverse, etc. Il n'y a pas encore de date officielle précise.
  • Version ERes2NetV2 :Publication des modèles pré-entraînés ERes2NetV2 et ERes2NetV2_w24s4ep4, formés sur la base de l'ensemble de données de 200 000 locuteurs, avec moins de paramètres et une inférence plus rapide. Il n’y a pas encore de date officielle précise.
  • Expansion multimodale et SSL :Publication des recettes de formation du modèle X-vecteur auto-supervisé SDPN, des recettes de formation du module visuel (TalkNet) et du module sémantique (BERT). Il n’y a pas encore de date officielle précise.
  • Runtime ONNX et ERes2NetV2 VoxCeleb :Sortie du runtime d'inférence ONNX Runtime ; a publié le modèle ERes2NetV2 basé sur l'ensemble de données VoxCeleb. Il n’y a pas encore de date officielle précise.
  • ID de langue et diarisation multimodale :Publier la formule de reconnaissance linguistique qui fusionne les informations phonémiques ; publiez la formule de journal de locuteur multimodale qui fusionne les images audio et vidéo. Il n’y a pas encore de date officielle précise.
  • Recettes ResNet et Res2Net :Publier les recettes de formation et d'inférence de ResNet34 et Res2Net sur les ensembles de données 3D-Speaker, VoxCeleb et CN-Celeb ; publiez la recette de réglage fin à grande marge. Il n’y a pas encore de date officielle précise.
  • ERes2Net-Base pré-entraîné :Publication du modèle pré-entraîné basé sur ERes2Net, formé sur un ensemble de données de 200 000 locuteurs chinois mandarin. Il n’y a pas encore de date officielle précise.
  • Lancement des modèles de base :Publication des modèles de pré-formation CAM++, ERes2Net-Base et ERes2Net-Large ; a publié des modules de détection de dialogue et de détection de commutation de locuteur sémantique. Il n’y a pas encore de date officielle précise.
  • Ensemble de données et version initiale :Publication officielle de l'ensemble de données 3D-Speaker ainsi que des modèles de base et des tests de référence tels que ERes2Net, CAM++ et RDINO. Il n’y a pas encore de date officielle précise.

Avis des utilisateurs

  • Chargement des avis...