Sortie d'OpenAI Whisper v20250625 : la norme de facto pour la reconnaissance vocale open source continue d'itérer

OpenAI Whisper a publié la v20250625 le 26 juin 2025 ; ce système ASR open source basé sur 680 000 heures de formation sur des données multilingues est proche des niveaux humains en termes de robustesse et de précision et constitue l'un des standards de facto de la communauté vocale open source.

Le 26 juin 2025, OpenAI a publié le modèle de reconnaissance vocale open source Whisper v20250625 (version 20250625). Pour de nombreux développeurs, Whisper n'est peut-être pas une « actualité », mais un outil par défaut qui s'exécute en arrière-plan tous les jours - c'est la représentation du « standard de facto » dans la communauté vocale open source.

Pourquoi est-ce la norme de facto ?

Formé sur 680 000 heures de données supervisées multilingues et multitâches collectées sur le Web, Whisper atteint une robustesse et une précision proches du niveau humain dans la reconnaissance vocale en anglais, et prend en charge la transcription et la traduction multilingues vers l'anglais. Son architecture est Encoder-Decoder Transformer : l'audio d'entrée est divisé en segments de 30 secondes, converti en un spectrogramme mel logarithmique, puis entre dans l'encodeur. Le décodeur prédit les titres de texte et les mélange avec des jetons spéciaux pour réaliser un multitâche sur modèle unique tel que la reconnaissance linguistique, l'horodatage au niveau des phrases, la transcription multilingue et la traduction en anglais.

Le rythme de la ligne de version

La ligne de version principale est v20230307 → v20240930 → v20250625, qui continuera à être réparée et optimisée avec la communauté. Chaque version est peaufinée en détail : le taux d'erreur est d'environ 50 % inférieur à celui du modèle précédent, et il est connu pour ses "données diverses à grande échelle + sa robustesse sans échantillon" - cela signifie que Whisper a une capacité naturelle de généralisation aux accents invisibles et aux environnements bruyants, et c'est la capacité la plus appréciée dans l'environnement de production.

Exemple de signification du statut de la communauté open source

Du point de vue de l'industrie, Whisper signifie bien plus qu'un « modèle vocal ». Il s'agit d'un exemple classique du « modèle open source des grands fabricants devenant le standard de facto dans la communauté » : il ne s'appuie pas sur des API sources fermées pour verrouiller les clients, mais sur un poids open source + des capacités robustes, faisant de Whisper la dépendance sous-jacente d'innombrables outils de translittération, outils de sous-titres et assistants vocaux. Pour les équipes vocales nationales, le parcours réussi de Whisper constitue une référence : lorsque les capacités du modèle sont suffisamment stables et participent à l'écosystème avec une attitude open source, elles peuvent acquérir une puissance de diffusion qui dépasse de loin celle d'un écosystème auto-construit. Ses itérations continues de versions rappellent également aux retardataires que l’open source n’est pas une action ponctuelle, mais un engagement à long terme.

Plusieurs orientations à suivre dans le futur :

  1. Qualité de reconnaissance du chinois et des dialectes : performances des capacités multilingues dans les scénarios chinois à longue traîne.
  2. Évolution de la reconnaissance du streaming : la demande de la communauté en matière de transcription en temps réel entraînera-t-elle des changements dans l'architecture de Whisper ?
  3. Concurrence avec d'autres ASR open source : un lot de nouveaux modèles vocaux open source remettra-t-il en question le statut de standard de facto de Whisper ?
  4. Cadence de publication des nouvelles versions : à quelle fréquence OpenAI continuera à être mis à jour à partir de la v20250625.
Copyright : Contenu source Sorties d'OpenAI GitHub . Cette plateforme a compilé et organisé ce contenu à des fins d'information et d'échange éducatif. Pour tout problème de droit d'auteur, veuillez nous contacter.

Avis

  • Chargement des avis...