Whisper large-v3 : la version « plafond » de la reconnaissance vocale open source, l'accumulation de plus de 99 transcriptions linguistiques et 680 000 heures de formation faiblement supervisées
Whisper large-v3 est actuellement la plus grande version publique du modèle Whisper, atteignant le niveau le plus élevé précédent en matière de qualité de transcription et de traduction multilingue, et héritant de l'accumulation itérative de 680 000 heures de formation faiblement supervisée en 2022.
Whisper large-v3 : La version "plafond" de la reconnaissance vocale open source, l'accumulation de plus de 99 transcriptions linguistiques et 680 000 heures de formation faiblement supervisée
Whisper large-v3 est actuellement la plus grande version publique du modèle Whisper. Il sortira fin 2023 et atteint le plus haut niveau de la série en termes de transcription multilingue et de qualité de traduction. En tant que modèle général de reconnaissance vocale open source par OpenAI sous licence MIT, il poursuit le parcours technique de la version initiale de septembre 2022 (680 000 heures de données multilingues faiblement supervisées, couvrant plus de 99 langues), et constitue une solution ASR open source de référence pour la création d'applications vocales.
- LA PLUS GRANDE VERSION PUBLIQUE : large-v3 est le plus grand modèle public de la série Whisper, avec une qualité de transcription et de traduction atteignant le plus haut niveau jamais atteint.
- Couverture multilingue : prend en charge la translittération, la traduction et l'alignement de l'horodatage dans plus de 99 langues.
- Licence MIT : gratuite pour un usage commercial et un déploiement local, c'est l'un des standards de facto pour la reconnaissance vocale open source.
- Plusieurs échelles disponibles : cinq échelles, de la plus petite à la plus grande, couvrant les besoins des appareils de pointe aux scénarios de haute précision.
Arrière-plan de la version
Whisper est le modèle de reconnaissance vocale générale open source d'OpenAI, qui adopte un paradigme de formation à grande échelle faiblement supervisé : la version initiale est formée sur la base de 680 000 heures de données multilingues et ne repose pas sur une annotation manuelle, obtenant ainsi une large couverture linguistique. L'évolution de sa version reflète un chemin d'itération clair : large (2022-09-21) est la version initiale ; large-v2 (2022-12) améliore les performances multilingues et réduit les taux d'erreur ; large-v3 (2023-11) devient la version publique la plus large, atteignant le plus haut niveau de la série en matière de transcription et de traduction multilingues.
Points forts de cette version
Amélioration de la qualité de la reconnaissance
- Transcription multilingue : large-v3 a considérablement amélioré la transcription vocale multilingue par rapport à la génération précédente, et le taux d'erreur dans les scénarios de langue faible a considérablement diminué.
- Capacité de traduction : prend en charge la traduction de discours non anglais vers l'anglais pour servir des scénarios de traitement de contenu multilingues.
- Alignement de l'horodatage : fournit des horodatages mot par mot pour prendre en charge la génération de sous-titres et les applications d'alignement audio et vidéo.
Écologie de l'ingénierie
- Déploiement multi-échelle : gradient minuscule/base/petit/moyen/grand, choisissez à la demande, de la périphérie au cloud de haute précision.
- Mise en œuvre accélérée par la communauté : les implémentations communautaires telles que Whisper.cpp et Faster-Whisper améliorent considérablement l'efficacité de l'inférence et prennent en charge les opérations du processeur et du GPU grand public.
- Déploiement local : Il peut être auto-hébergé librement sous licence MIT, et les données peuvent être retranscrites sans quitter le pays.
Signification pour les développeurs
D'un point de vue industriel, la valeur de Whisper large-v3 réside dans la transformation de la « reconnaissance vocale de haute qualité » en une infrastructure disponible gratuitement. Pour les développeurs nationaux, cela signifie qu'ils peuvent effectuer la transcription vocale, les procès-verbaux de réunions, la génération de sous-titres et le traitement de contenu multilingue dans leurs propres pipelines de données sans recourir à des API commerciales. Par rapport aux services d'identification commerciaux, le principal compromis de Whisper auto-hébergé est « des coûts contrôlables + la confidentialité des données » par rapport à « des services de réglage et une latence ultra-faible ».
Dans la pile de capacités vocales, Whisper est responsable du lien « compréhension » et complète l'interface vocale de OpenAI API - la première peut être auto-hébergée et la seconde peut être utilisée immédiatement. Lorsque des capacités de « parler » et de « conversation » sont requises, les produits TTS et d'agent vocal doivent être combinés pour former un lien complet.
Conseils pour commencer
- Vérification rapide : commencez avec un modèle moyen/grand et évaluez la précision de la reconnaissance de l'ensemble de langues cible.
- Déploiement en production : utilisez plus rapidement-whisper ou murmure.cpp pour optimiser l'inférence et travaillez avec VAD pour traiter les fichiers audio longs.
- Scène de sous-titres/minutes : utilisez la capacité d'alignement d'horodatage pour générer directement des sous-titres ou des enregistrements de réunion avec une chronologie.
Orientations dignes d'attention à l'avenir
- Maturité des solutions d'accélération communautaire : le compromis entre l'efficacité et la précision de l'inférence entre Whisper.cpp et Faster-Whisper.
- Optimisation du chinois et des dialectes : performances mesurées et pratique de réglage précis dans les scénarios de prononciation, d'accent et de dialecte chinois.
- Concurrence et coopération avec les ASR commerciaux : La frontière entre les solutions auto-hébergées et les services commerciaux, et comment les combiner de manière optimale selon les scénarios.
Avis