Amusant-ASR1.5 Gratuit

-

Fun-ASR1.5 est un vaste modèle de reconnaissance vocale de bout en bout lancé par l'équipe Alibaba Tongyi. Basé sur l'architecture MoE, un modèle unique prend en charge 30 langues, sept systèmes dialectaux majeurs et plus de 20 accents locaux, et intègre des capacités intelligentes de prédiction de ponctuation et de normalisation de texte.

Amusant-ASR1.5 Interface du produit

Fun-ASR1.5 : modèle de reconnaissance vocale de bout en bout d'Alibaba Tongyi

Paramètres et statistiques de base de Fun-ASR1.5

Projet Détails
Nom du produit Fun-ASR1.5 (modèle de reconnaissance vocale Alibaba Tongyi)
Type de produit Reconnaissance vocale de bout en bout grand modèle
Formulaire de livraison Bibliothèque Python/API/CLI/Serveur MCP
Langues prises en charge 30 langues (chinois, anglais, japonais, coréen, français, allemand, espagnol, portugais, russe, arabe, etc.)
Couverture dialectale Sept systèmes dialectaux majeurs, axés sur l'optimisation de 15 dialectes très demandés tels que les dialectes shanghaïen, cantonais et du Sichuan
Architecture MoE (Architecture Experte Mixte)
Dernière version FunASR 1.3.19 (2026-07-19)
Accord open source MIT (Toolkit) / Les poids des modèles sont fournis avec un accord séparé
Étoiles GitHub 19,3k
Utilisateurs cibles Développeurs, entreprises, instituts de recherche

Interprétation des paramètres : un modèle unique couvrant 30 langues signifie qu'il n'est pas nécessaire de conserver des instances de modèle distinctes pour chaque langue pendant le déploiement. L'architecture MoE garantit que le module expert correspondant n'est activé que lorsqu'un langage spécifique est reconnu, et que l'efficacité du raisonnement est supérieure à celle d'un modèle dense de même échelle. Le taux d'erreur de dialecte (CER) a diminué de 56,2 % par rapport à la version précédente, ce qui peut réduire considérablement les coûts de relecture manuelle dans des scénarios pratiques.

Utilisateurs et reconnaissance du marché de Fun-ASR1.5

Derrière Fun-ASR1.5 se trouve le projet open source FunASR (GitHub 19,3k Stars) de l'Alibaba Damo Academy. Il s'agit actuellement de l'une des boîtes à outils de bout en bout les plus actives de la communauté chinoise de reconnaissance vocale. Les téléchargements cumulés de PyPI ont couvert un grand nombre de développeurs individuels et d'utilisateurs d'entreprise, avec plus de 178 contributeurs communautaires.

Dans le test de référence, Fun-ASR-Nano (le modèle phare de la série Fun-ASR1.5) a atteint un taux d'erreur de mot (CER) de seulement 8,20 % sur l'ensemble de tests audio longs chinois, ce qui est bien inférieur aux 21,71 % de Whisper-large-v3-turbo. La vitesse d'inférence a atteint 340 fois en temps réel (avec vLLM), soit plus de 26 fois celle de Whisper. Le modèle SenseVoiceSmall peut réaliser une inférence en temps réel 17x sur le CPU et peut atteindre un débit de niveau production sans avoir besoin d'un GPU.

Ce projet a été largement utilisé dans des scénarios tels que les procès-verbaux de réunions, le service client intelligent, la recherche vocale, la génération de sous-titres et l'éducation en ligne. Les utilisateurs de niveau entreprise peuvent appeler directement l'API via la plateforme Alibaba Cloud Bailian.

Avantages financiers de Fun-ASR1.5

Fun-ASR1.5 est un projet entièrement open source et son principal avantage est un coût de licence nul.

Dimension du coût Descriptif
Utilisation de la boîte à outils Licence MIT, entièrement gratuite et disponible pour un usage commercial
Poids du modèle Sous réserve du modèle de contrat de carte, dont la plupart sont gratuits pour un usage commercial
Appel API (Alibaba Cloud Bailian) Facturation au fur et à mesure, veuillez vous référer au devis en temps réel d'Alibaba Cloud
Déploiement privé Construisez votre propre serveur et ne supportez que le coût de l'infrastructure
Comparaison de produits concurrents (API Whisper) La vitesse d'inférence est 26 fois plus élevée en cas d'auto-déploiement et le coût du matériel est considérablement réduit avec le même débit

Coût côté C : l'expérience en ligne via Moda Community est entièrement gratuite et le déploiement local ne nécessite qu'une machine dotée d'un GPU (le CPU peut également exécuter le modèle SenseVoiceSmall). Coût final de l'entreprise : les entreprises peuvent choisir de payer à l'utilisation pour l'API Alibaba Cloud Bailian, ou de la déployer en privé pour éviter que les données ne sortent du domaine. En mode auto-déploiement, l'efficacité d'inférence de Fun-ASR1.5 lui permet de transporter une concurrence beaucoup plus élevée que Whisper sur le même matériel.

Principales fonctions de Fun-ASR1.5

  • Reconnaissance multilingue : un seul modèle couvre 30 langues, dont le chinois, l'anglais, le japonais, le coréen, le français, l'allemand, l'espagnol, le portugais, le russe et l'arabe. Il n'est pas nécessaire de déployer des modèles indépendants pour chaque langue. Convient aux conférences transnationales et aux scénarios de production de contenu multilingue.

  • Changement automatique de langue (Code-Switching) : Pas besoin de prédéfinir des balises de langue, reconnaît et traite automatiquement les voix mixtes multilingues dans la même conversation. Ceci est extrêmement pratique pour des scénarios tels que des réunions d’affaires et des podcasts technologiques où le chinois et l’anglais sont mélangés, éliminant ainsi l’annotation fastidieuse de segmentation manuelle.

  • Reconnaissance des dialectes et des accents : couvre sept systèmes dialectaux majeurs et plus de 20 accents locaux, en se concentrant sur l'optimisation de 15 dialectes très demandés tels que le shanghaïen, le cantonais, le sichuan et le hokkien. Le taux d'erreur des caractères dialectaux a diminué de 56,2 % par rapport à la version précédente, permettant ainsi la restauration des caractères dialectaux originaux.

  • Reconnaissance de récitation de poésie ancienne : construction d'un corpus de récitation en personne réelle couvrant des textes classiques tels que "Le Livre des chansons", "Chu Ci", les poèmes de Li Bai et Du Fu, les poèmes Ci de Su Shi et Xin Qiji, avec une précision au niveau des caractères de 97 %. Il a une valeur unique pour le scénario numérique de l’enseignement des études chinoises et de l’héritage culturel.

  • Post-traitement intelligent : insérez automatiquement des signes de ponctuation tels que des virgules, des points, des points d'interrogation, etc. en fonction de la sémantique contextuelle, et convertissez automatiquement les nombres prononcés, les dates, les montants, les appels téléphoniques, etc. en formats écrits standardisés. Cette fonctionnalité peut réduire considérablement le temps d'édition manuelle de post-production pour des scénarios tels que les procès-verbaux de réunions et les transcriptions juridiques.

Fun-ASR1.5 évolution du modèle et de la version

Fun-ASR1.5 est un projet open source qui continue d'itérer. La dernière version principale est FunASR 1.3.19 (publiée le 19/07/2026). Le processus d’évolution de base est le suivant :

Version Dates Changements clés
FunASR 1.3.19 2026-07-19 Journaux de diagnostic de longue session WebSocket en temps réel regroupés dans la documentation PyPI
FunASR 1.3.18 2026-07-19 Correction de la régression de la segmentation des sous-titres CLI, la sortie SRT est segmentée par phrases
FunASR 1.3.17 2026-07-19 Améliorations du runtime SenseVoice llama.cpp, prise en charge de Windows CUDA
FunASR 1.3.16 2026-07-18 Service WebSocket en temps réel Fun-ASR-Nano installé directement depuis PyPI
FunASR 1.3.15 2026-07-17 Amélioration de la fiabilité du streaming, correctif de compatibilité Fun-ASR-Nano
FunASR 1.3.3 2026-05-24 CLI funasr-server, API compatible OpenAI, serveur MCP
Fun-ASR-Nano-2512 2025-12-15 Sortie du premier modèle phare Fun-ASR-Nano

En termes de pedigree de modèles, la boîte à outils FunASR propose plusieurs choix de modèles : Fun-ASR-Nano (chinois/anglais/japonais + dialecte), Fun-ASR-MLT-Nano (31 langues), SenseVoiceSmall (5 langues + reconnaissance des émotions), Paraformer (ASR de streaming à faible latence), Qwen3-ASR (52 langues), etc. Les utilisateurs peuvent sélectionner de manière flexible en fonction de la précision de la scène, de la couverture linguistique et des conditions matérielles.

Avantages techniques de Fun-ASR1.5

Les principaux avantages techniques de Fun-ASR1.5 peuvent être décomposés à trois niveaux : architecture, efficacité d'inférence et flexibilité de déploiement :

  • Architecture experte hybride MoE : le modèle contient plusieurs sous-réseaux d'experts liés aux langues. Lorsqu'une langue spécifique est entendue, seul le module expert correspondant est activé. Cette conception rend l'efficacité des paramètres d'un modèle unique couvrant 30 langues bien supérieure à celle d'un modèle dense de même échelle. La quantité de calcul lors de l'inférence est considérablement réduite. Dans le même temps, chaque module expert peut être optimisé indépendamment sans interférer les uns avec les autres.

  • Stratégie de formation graduée et par étapes : utilisez des données précises pour la formation par étapes et étapes - effectuez d'abord une pré-formation générale multilingue, puis un réglage fin du dialecte/accent, et enfin effectuez un alignement de scènes spéciales (telles que la poésie ancienne). Ce processus de formation rend le modèle nettement plus robuste dans des scénarios vocaux complexes du monde réel qu'un modèle formé en une seule étape.

  • Matrice de déploiement full-link : De la bibliothèque Python (pip install funasr) au service API compatible OpenAI (funasr-server), du binaire Edge-side llama.cpp/GGUF au déploiement conteneurisé Docker, du serveur MCP au moteur d'inférence par lots vLLM, couvrant l'ensemble des besoins de déploiement, des machines de développement personnel aux clusters de production à grande échelle. En particulier, le runtime llama.cpp apporte FunASR aux processeurs purs et aux appareils de périphérie sans avoir besoin d'un runtime Python, ce qui lui confère des avantages uniques dans les scénarios IoT et embarqués.

  • Leader en termes de performances d'inférence : Fun-ASR-Nano + vLLM atteint 340x en temps réel (RTFx), SenseVoiceSmall atteint 17x en temps réel sur le processeur. Par rapport au 13 fois temps réel (GPU) de Whisper-large-v3, la vitesse d'inférence de FunASR sur le CPU dépasse même les performances de Whisper sur le GPU, faisant du déploiement sans carte du CPU une solution réalisable.

Fun-ASR1.5 Comment utiliser

Fun-ASR1.5 offre une variété de méthodes d'utilisation, et les développeurs peuvent choisir de manière flexible en fonction du scénario :

Entrée Descriptif
Bibliothèque Python (pip) pip install funasr, appelé via l'API AutoModel
Ligne de commande CLI funasr audio.wav est une translittération et prend en charge la sortie SRT/JSON
API compatible OpenAI funasr-server --device cuda démarre le service, POST /v1/audio/transcriptions
Serveur MCP Pour que les agents IA tels que Claude/Curseur appellent les capacités de reconnaissance vocale
Expérience en ligne de la communauté Magic Scope Utilisez le navigateur directement, aucune installation requise : https://modelscope.cn/studios/iic/FunAudio-ASR
lama.cpp binaire Exécution CPU/Edge pure, aucun contexte Python requis

Démarrez rapidement avec Python :

à partir de funasr importer un modèle automatique

modèle = AutoModel(model="FunAudioLLM/Fun-ASR-Nano-2512", appareil="cuda")
résultat = model.generate(input="audio.wav")
imprimer(résultat[0]["texte"])

Transcription CLI sur une ligne :

funasr audio.wav --output-format json --spk --timestamps

Démarrer le service API :

funasr-server --device cuda
# Une fois le service démarré, fournissez une interface compatible OpenAI sur localhost:8000

Processus d'utilisation typique : Installer FunASR → Charger le modèle (télécharger automatiquement les poids) → Entrée de fichiers/flux audio → Obtenir des résultats de reconnaissance structurés → Post-traitement (ponctuation/normalisation). Il n'est pas nécessaire de définir manuellement les balises de langue tout au long du processus, le modèle le reconnaît automatiquement.

Prix des produits pour Fun-ASR1.5

La stratégie open source de Fun-ASR1.5 lui confère des avantages financiers significatifs :

  • Community Edition (gratuit) : installez le téléchargement du référentiel GitHub via PyPI et découvrez la Magic Community en ligne, le tout gratuitement. La licence open source MIT permet une utilisation commerciale et un développement secondaire.
  • API Alibaba Cloud Bailian (pay-as-you-go) : Pour les utilisateurs qui ne souhaitent pas créer leur propre infrastructure, ils peuvent appeler l'API via la plateforme Alibaba Cloud Bailian et être facturés en fonction du nombre d'appels. Le prix spécifique est soumis à la page de tarification en temps réel d'Alibaba Cloud.
  • Déploiement privatisé par l'entreprise (auto-construit) : les entreprises peuvent déployer sur leurs propres serveurs et ne doivent supporter que le coût des ressources informatiques. Tirant parti de la grande efficacité d'inférence de FunASR, un seul GPU peut gérer un grand nombre de requêtes simultanées.

Par rapport aux services commerciaux de reconnaissance vocale (tels que Azure Speech, Google Cloud Speech-to-Text, Whisper API), le TCO (coût total de possession) de la solution d'auto-déploiement Fun-ASR1.5 présente des avantages significatifs dans les scénarios d'utilisation à moyenne et grande échelle, et les données ne sortent pas du domaine, répondant ainsi aux exigences de conformité.

Scénarios d'application de Fun-ASR1.5

  • Conférences multilingues et transcription multilingue : transcrivez avec précision le contenu des dialogues mixtes multilingues en temps réel lors de réunions multinationales. Il n'est pas nécessaire de prédéfinir les langues à l'avance. Un seul modèle peut couvrir 30 langues. La ponctuation automatique et la normalisation du texte réduisent considérablement les coûts de post-traitement.

  • Analyse vocale intelligente du service client : transcrit par lots les enregistrements d'appels du service client en texte structuré, prend en charge la reconnaissance des dialectes et la séparation des locuteurs, et peut être utilisé pour la surveillance de la qualité du service, l'exploration des problèmes chauds et l'analyse des sentiments.

  • Éducation en ligne et numérisation des études chinoises : La précision des caractères de 97 % de la reconnaissance des récitations de poésie ancienne en fait un outil unique pour l'enseignement des études chinoises en ligne, qui peut traduire les récitations des étudiants en texte en temps réel et effectuer des comparaisons et des notations.

  • Production de contenu et génération de sous-titres : les créateurs de vidéos peuvent transcrire l'audio dans des fichiers de sous-titres SRT via une commande CLI sur une seule ligne. Il prend en charge les balises de locuteur et les horodatages et convient à la production de contenu tel que des podcasts, des vidéos de cours et des interviews d'actualité.

  • Interaction vocale entre l'IoT et les appareils de périphérie : lorsqu'il est exécuté via llama.cpp/GGUF, Fun-ASR1.5 peut fonctionner sur des appareils à processeur pur et convient aux scénarios de périphérie tels que les haut-parleurs intelligents, la voix de voiture et le contrôle industriel.

Groupes applicables de Fun-ASR1.5

  • Développeurs d'applications IA : les développeurs qui ont besoin d'intégrer la reconnaissance vocale dans leurs propres applications peuvent y accéder rapidement via le SDK Python, l'API REST ou le serveur MCP. pip install funasr peut démarrer.

  • Enterprise IT and Data Team : Pour les entreprises qui ont besoin de privatiser le déploiement de services de reconnaissance vocale, FunASR fournit une matrice de déploiement complète (Docker, Kubernetes, API compatible OpenAI) pour prendre en charge les données ne quittant pas le domaine.

  • Institutions de recherche et utilisateurs académiques : pondérations de modèles open source et chaîne complète d'outils de formation et de réglage fin, adaptés aux travaux de recherche en reconnaissance vocale, dialectologie, ASR multilingue et autres domaines.

  • Créateurs de contenu et personnel des médias : créateurs qui ont besoin de transcrire rapidement l'audio/vidéo en texte et de générer des sous-titres. La CLI peut compléter le transcodage avec une seule ligne de commandes et prend en charge la sortie dans des formats tels que SRT/JSON/VTT.

  • Ne convient pas à la foule : pour les scénarios de communication en temps réel avec des exigences strictes en matière de latence ultra-faible (<100 ms de bout en bout), il est recommandé d'évaluer après test ; Il est recommandé aux utilisateurs qui ont besoin de services d'hébergement d'exploitation et de maintenance sans cloud de donner la priorité à l'API Alibaba Cloud Bailian au lieu de l'auto-déploiement ; Les utilisateurs professionnels purs qui ne sont pas familiers avec la ligne de commande ou la programmation Python doivent utiliser l'interface visuelle Alibaba Cloud Bailian ou une intégration tierce.

Résumé et perspectives de Fun-ASR1.5

Fun-ASR1.5 est une réalisation open source importante de l'équipe d'Alibaba Tongyi dans le domaine de la reconnaissance vocale. Sa principale compétitivité réside dans : la couverture multilingue d'un modèle unique (30 langues + sept dialectes principaux) réduit la complexité d'exploitation et de maintenance du déploiement multimodèle ; l'efficacité d'inférence apportée par l'architecture MoE lui permet d'atteindre un débit bien supérieur à celui des produits concurrents sur le même matériel ; la stratégie open source full-link (protocole MIT + chaîne d'outils de déploiement complète) offre aux entreprises et aux développeurs une infrastructure de reconnaissance vocale à faible coût et hautement contrôlable.

Limitations : bien que les poids des modèles puissent être utilisés gratuitement, les accords de licence des différents modèles sont différents et les conditions d'autorisation de la carte de modèle spécifique doivent être confirmées avant une utilisation commerciale ; les scénarios de streaming à latence ultra faible (tels que la traduction intercom en temps réel) nécessitent toujours un réglage ciblé ; pour les appareils périphériques à ressources extrêmement faibles (niveau MCU), le runtime llama.cpp est toujours optimisé en permanence.

Évaluation des risques d'approvisionnement/d'adoption : en tant que projet open source maintenu par Alibaba Damo Academy, FunASR bénéficie d'un soutien communautaire et d'entreprise stable et à long terme, avec 19,3 000 étoiles GitHub et 178 contributeurs prouvant son activité écologique. Les entreprises doivent faire attention lors de l'adoption : la version open source ne fournit pas de garantie SLA, et il est recommandé aux principales entreprises de production d'obtenir une assistance au niveau de l'entreprise via l'API Alibaba Cloud Bailian ; les accords de licence indépendants pour les poids des modèles doivent être confirmés un par un avant toute utilisation commerciale ; le rythme d'itération du projet est rapide (plusieurs petites versions sont publiées chaque mois) et les entreprises de production doivent verrouiller la version et effectuer des tests de régression. Dans l'ensemble, Fun-ASR1.5 est actuellement l'une des options open source les plus rentables dans le domaine de la reconnaissance vocale chinoise pour les équipes disposant de capacités d'auto-construction et d'exigences de conformité des données.

Outils associés : , udio

Informations de version

  • FunASR 1.3.19 :Ajout de la fonction de diagnostic de longue session WebSocket en temps réel, amélioration de la génération de sous-titres CLI et du chargement de la ponctuation, et documentation de la communauté mise à jour.
  • FunASR 1.3.18 :Correction d'un problème de régression de segmentation des sous-titres SRT, prise en charge de la demande d'horodatage au niveau de la phrase et amélioration du chargement du modèle de ponctuation.
  • FunASR 1.3.17 :Ajout de journaux de diagnostic de session WebSocket en temps réel, améliorations du runtime SenseVoice llama.cpp, prise en charge de Windows CUDA.
  • FunASR 1.3.16 :Le service WebSocket en temps réel Fun-ASR-Nano peut être installé directement à partir de PyPI et prend en charge le mode point de terminaison piloté par le client.
  • FunASR v1.3.15 :Améliorez la fiabilité du streaming, résolvez les problèmes de compatibilité Fun-ASR-Nano et améliorez la CLI et le traitement du texte.

Avis des utilisateurs

  • Chargement des avis...