Alibaba lance Qwen-Audio-3.0-ASR-Flash : longue cohérence audio, personnalisation des mots chauds et sortie structurée

Alibaba a publié le modèle de reconnaissance vocale Qwen-Audio-3.0-ASR-Flash, qui améliore la cohérence du contexte audio long, la reconnaissance professionnelle des mots de l'industrie et la personnalisation des mots chauds, et ajoute des capacités de polissage vocal et de sortie de texte structuré.

Le camp de reconnaissance vocale open source (ASR) d'Alibaba a ajouté un nouveau membre : Qwen-Audio-3.0-ASR-Flash, conçu pour les scénarios de transcription vocale à haut débit et à faible latence. Par rapport à l'itération conventionnelle de « conversion en texte », cette mise à niveau est évidemment plus proche de la mise en œuvre réelle : une longue cohérence audio, une reconnaissance professionnelle des mots de l'industrie, une personnalisation des mots chauds, un polissage de la voix et une sortie structurée sont réalisés ensemble.

Accédez directement aux trois points faibles de la transcription de la parole chinoise

Cohérence du contexte audio long cible les problèmes courants d'« incohérence et de dérive de contenu » dans les scénarios de longs discours et de longs dialogues ; La personnalisation des mots chauds permet aux utilisateurs d'injecter des noms, des marques et des termes spécifiques du secteur dans le processus de reconnaissance pour améliorer la précision. Ces deux reconnaissances de mots professionnelles superposées sont presque conçues sur mesure pour des scénarios chinois à haute fréquence tels que les procès-verbaux de réunions et les inspections de la qualité du service client. Il s'agit également de la partie la plus difficile et la plus précieuse de la reconnaissance vocale chinoise.

De "convertir le texte" à "peut être organisé par l'agent"

Les plus remarquables sont le polissage de la voix et la sortie de texte structuré. Le premier optimise la lisibilité du texte transcrit, tandis que le second génère directement des données structurées afin que les systèmes en aval (procès-verbaux de réunion, contrôle de la qualité du service client, génération de sous-titres) puissent être consommés sans nettoyage secondaire. Cela signifie que l'ASR passe d'une « capacité basée sur des outils » à un « composant pouvant être directement orchestré par les agents », et sa valeur écologique n'est plus du tout au même niveau.

En tant que fichier Flash, le modèle se concentre sur une faible latence et un débit élevé. Il convient au déploiement à grande échelle dans des scénarios en temps réel tels que les sous-titres en direct et le service client vocal, et forme une couverture dégradée avec le fichier phare. Cela continue également la ligne globale Qwen d'open source + multimodale - la reconnaissance vocale n'est qu'une pièce du puzzle Qwen full-modal. La future collaboration avec les capacités de voix et d’image mérite d’être attendue avec impatience.

Plusieurs orientations à suivre dans le futur :

  1. Mesures réelles d'audio long et de mots chauds : L'évaluation de la précision dans des scénarios réels est plus convaincante que les données de conférence de presse.
  2. Performances du retard de l'équipement Flash : le délai de bout en bout des scénarios en temps réel détermine la limite de déploiement.
  3. Collaboration entièrement modale avec Qwen : Les progrès de l'intégration des modèles unifiés de parole et de vision.
Copyright : Contenu source flux utilisateur . Cette plateforme a compilé et organisé ce contenu à des fins d'information et d'échange éducatif. Pour tout problème de droit d'auteur, veuillez nous contacter.

Avis

  • Chargement des avis...