AmusantASR Gratuit

-

FunASR est une boîte à outils open source de reconnaissance vocale de qualité industrielle d'Alibaba Tongyi Lab. Il intègre l'ASR, le VAD, la récupération de ponctuation, la séparation des locuteurs, la détection des émotions et la reconnaissance des événements audio. Il fournit une interface Python unifiée et une API compatible OpenAI, prend en charge l'inférence de taux en temps réel 340x dans plus de 50 langues et peut être entièrement privatisé pour le déploiement.

AmusantASR Interface du produit

FunASR : la boîte à outils open source de reconnaissance vocale de qualité industrielle d'Alibaba Tongyi Lab

Paramètres et statistiques de base de FunASR

Projet Détails
Nom du produit FunASR (Reconnaissance vocale audio amusante)
Type de produit Boîte à outils de reconnaissance vocale Open Source
Formulaire de livraison SDK Python / CLI / Serveur API compatible OpenAI / Docker / llama.cpp Déploiement Edge
Langues prises en charge Plus de 50 langues (Fun-ASR-Nano prend en charge les dialectes chinois/anglais/japonais et chinois ; MLT-Nano prend en charge 31 langues ; Qwen3-ASR prend en charge 52 langues)
Taille du modèle 0,4M (fsmn-vad) ~ 1,7B (Qwen3-ASR)
Étoiles GitHub 19,3k
Accord open source MIT (boîte à outils); les poids des modèles sont sous licence conformément aux accords respectifs
Utilisateurs cibles Développeurs, équipes d'IA d'entreprise, intégrateurs de produits vocaux

FunASR n'est pas un produit SaaS unique, mais une chaîne complète d'outils open source de compréhension vocale. Il fournit un « pipeline de bout en bout » depuis l'audio brut jusqu'au texte structuré - segmentation VAD, reconnaissance ASR, récupération de ponctuation, séparation des locuteurs, détection des émotions, reconnaissance des événements audio - le tout via une seule ligne d'appels API « AutoModel ». Les développeurs peuvent déployer indépendamment localement, sur intranet ou dans le cloud sans envoyer de données audio à des services API tiers.

Indicateurs quantitatifs clés : l'inférence Fun-ASR-Nano + vLLM peut atteindre un taux en temps réel (RTF) de 340x, SenseVoiceSmall peut atteindre un débit en temps réel de 17x sur le processeur et un CER aussi bas que 7,81 % à 8,20 %, ce qui est tous deux meilleurs que le CER de 20 % et le taux en temps réel de 13x de Whisper-large-v3.

Utilisateurs et reconnaissance du marché de FunASR

  • GitHub 19,3 000 étoiles, 178 contributeurs, 25 versions officielles, est l'une des boîtes à outils ASR open source les plus actives sur GitHub.
  • Les téléchargements mensuels PyPI continuent de croître et le package « funasr » est devenu l'une des principales dépendances de l'écosystème Python ASR.
  • Adoption par l'entreprise : intégré en tant que module de saisie vocale par les frameworks d'IA grand public tels que RAGFlow, Dify, LangChain et AutoGen ; la communauté a accumulé plus de 30 projets d'intégration.
  • Analyse comparative de l'industrie : dans le scénario ASR chinois, le CER et le taux en temps réel de FunASR sont largement en avance sur la série Whisper (le taux d'erreur des mots chinois est environ 60 % inférieur et la vitesse d'inférence du processeur est 10 à 20 fois plus élevée), et il prend en charge la séparation des haut-parleurs, la détection des émotions et d'autres fonctionnalités que Whisper n'a pas.

Avantages financiers de FunASR

Dimension du coût Descriptif
Open source et gratuit Licence MIT Core Toolkit, pas de frais de licence, pas de frais d'appel API
Déploiement privé Peut être exécuté complètement hors ligne sur l'intranet/une seule machine, sans risque de fuite de données et sans pression sur la facturation à l'utilisation
Seuil matériel SenseVoiceSmall peut atteindre un taux en temps réel 17x sur CPU sans GPU ; Fun-ASR-Nano recommande 8 Go+ GPU
Comparez l'API Whisper Le service Cloud ASR coûte environ 0,006 $/minute ; Le coût d'auto-construction de FunASR ne comprend que l'amortissement du matériel et de l'électricité, ce qui permet d'économiser plus de 90 % dans les scénarios à haute fréquence

Analyse comparative : pour un scénario de moyenne à haute fréquence qui traite 1 000 heures d'audio par jour, les frais mensuels d'utilisation du cloud ASR sont d'environ 10 800 $, tandis que le déploiement auto-construit de FunASR ne nécessite qu'un investissement matériel unique (un serveur avec un GPU coûte entre 3 000 $ et 8 000 $), et le coût marginal ultérieur est proche de zéro. Pour les scénarios sensibles à la vie privée (médicaux, financiers, juridiques), la valeur du déploiement privatisé ne peut pas être mesurée par le prix.

Principales fonctions de FunASR

  • Reconnaissance ASR multimodèle : Intégrez Fun-ASR-Nano (chinois/anglais/japonais + dialecte), SenseVoiceSmall (5 langues + émotions + événements), Paraformer (streaming/hors ligne), Qwen3-ASR (52 langues), Whisper, etc., et changez de modèle avec la même API.
  • Détection d'activité vocale (VAD) : fsmn-vad au niveau de la milliseconde, seuil de silence adaptatif, segmentation automatique des fichiers audio longs.
  • Récupération de ponctuation et régularisation inverse du texte : le modèle ct-punc ajoute automatiquement la ponctuation et génère un texte canonique qui peut être lu directement.
  • Speaker Diarization : Le modèle CAM++ annote automatiquement « qui a dit quoi à quelle heure » et prend en charge les réunions à plusieurs.
  • Détection d'émotions et reconnaissance d'événements audio : SenseVoice intègre une reconnaissance d'émotions (heureux/triste/en colère/neutre) et une détection d'événements (applaudissements/rires/musique/pleurs).
  • Service API compatible OpenAI : la commande sur une ligne funasr-server démarre le service RESTful. Le SDK est compatible avec l'API OpenAI Audio et se connecte directement à LangChain/Dify/AutoGen.
  • Serveur MCP pour agents AI : les agents tels que Claude/Cursor peuvent appeler directement les capacités ASR locales.
  • Déploiement Edge (llama.cpp/GGUF) : aucun contexte Python requis, un seul binaire s'exécute sur le processeur/périphérique Edge, prend en charge Windows CUDA.

Evolution du modèle et de la version FunASR

Le projet FunASR a débuté en 2022 et a été initialement publié par Alibaba Damo Academy en tant que boîte à outils de reconnaissance vocale de bout en bout (article INTERSPEECH 2023). 2025-2026 entrera dans une période d’itération rapide :

Version Dates Changements fondamentaux
v1.3.19 2026-07-19 Documentation de dépannage de longue session WebSocket ; Améliorations des sous-titres segmentés CLI SRT
v1.3.16 2026-07-18 point de terminaison en temps réel piloté par le client ; lama.cpp Package Windows CUDA
v1.3.12 2026-06-21 Correctif Qwen3-ASR / GLM-ASR
v1.3.3 2026-05-24 CLI funasr-server, API OpenAI, serveur MCP, VAD dynamique
v1.3.0 2026-05-20 Qwen3-ASR (52 langues), GLM-ASR-Nano (17 langues) pris en charge
v1.2.x 2025-2026 Fun-ASR-Nano, moteur d'inférence vLLM llama.cpp edge runtime
v1.0 2024 Première version stable, intégration Paraformer/SenseVoice
v0.x 2022-2023 Version initiale, ASR de base et cadre de formation

Avantages techniques de FunASR

Boîte à outils au lieu d'un modèle unique : contrairement aux solutions à modèle unique telles que Whisper, FunASR est un "supermarché de modèles" : il existe un modèle dédié pour chaque sous-tâche (VAD, ASR, ponctuation, séparation des locuteurs, émotion) et peut être librement combiné. Par exemple, le pipeline de production « SenseVoice + fsmn-vad + ct-punc + cam++ » termine tous les traitements en un seul appel.

Suppression de l'efficacité de l'inférence :

  • Fun-ASR-Nano + vLLM : taux en temps réel 340x (26x plus rapide que Whisper-large-v3), CER 8,20 %
  • SenseVoiceSmall : 17x en temps réel sur CPU (plus rapide que Whisper sur GPU), CER 7,81 %
  • Architecture non autorégressive (Paraformer) : délai de premier mot extrêmement faible dans les scénarios de streaming, prend en charge la reconnaissance en temps réel de WebSocket

Flexibilité de déploiement : couvre tout le spectre, de « l'installation pip » à la conteneurisation Docker/Kubernetes en passant par le déploiement CPU/edge binaire unique llama.cpp. funasr-server fournit une API compatible OpenAI. Les applications avec un SDK existant n'ont besoin que de modifier « base_url » pour changer.

Prise en charge native de l'agent : le serveur MCP intégré et l'API OpenAI, les frameworks AI Agent tels que Claude Desktop, Cursor, LangChain, Dify, AutoGen, etc. peuvent intégrer directement des capacités vocales pour réaliser un flux de travail automatisé piloté par la voix.

Comment utiliser FunASR

Entrée Descriptif
SDK Python pip install funasr, appel sur une seule ligne AutoModel
CLI Transcription directe funasr audio.wav, prend en charge la sortie JSON/SRT/TSV
Serveur API funasr-server --device cuda démarre le point de terminaison compatible OpenAI
Docker Image Docker hors ligne/streaming, démarrage sur une seule ligne
lama.cpp Déploiement CPU/Edge binaire unique, aucun runtime Python requis

Démarrage rapide de Python :

à partir de funasr importer un modèle automatique

model = AutoModel(model="sensevoice", vad_model="fsmn-vad",
                  punc_model="ct-punc", spk_model="cam++", périphérique="cuda")
résultat = model.generate(input="meeting.wav", batch_size_s=300)
pour la segmentation dans le résultat[0]["sentence_info"] :
    print(f"[{seg['start']/1000:.1f}s] Haut-parleur {seg['spk']} : {seg['text']}")

Démarrer le service API :

pip install funasr vllm fastapi uvicorn python-multipart
funasr-server --device cuda --port 8899
# appel
curl -X POST http://localhost:8899/v1/audio/transcriptions \
  -F "[email protected]" -F "model=fun-asr-nano" -F "response_format=verbose_json"

Montage MCP (Claude Desktop) :

{
  "mcpServeurs": {
    "funasr": {
      "command": "serveur funasr",
      "args": ["--mcp", "--port", "8899"]
    }
  }
}

Prix des produits pour FunASR

La boîte à outils de base FunASR adopte la licence open source MIT et est entièrement gratuite, sans frais cachés, sans limite sur le nombre d'appels et sans émasculation fonctionnelle. Les entreprises peuvent réaliser un développement secondaire et une intégration commerciale basés sur le code source sans payer de frais de licence.

Les poids modèles adoptent un accord de licence indépendant. La plupart des modèles (SenseVoice, Paraformer, fsmn-vad, ct-punc, cam++, emotion2vec) peuvent être utilisés commercialement gratuitement. Les détails sont soumis à la licence de chaque modèle de carte.

Évaluation des coûts cachés :

  • Coût matériel du serveur GPU (8 Go+ VRAM recommandés pour Fun-ASR-Nano ; SenseVoiceSmall disponible pour CPU)
  • Coûts d'exploitation et de maintenance (déploiement et maintenance Docker/K8s)
  • Si vous utilisez l'accélération vLLM, vous devez installer des dépendances vLLM supplémentaires

Par rapport à l'ASR cloud commercial (tel que la reconnaissance vocale Alibaba Cloud Azure Speech, Whisper API), dans le scénario de traitement d'une moyenne de 100 heures d'audio par jour, le déploiement auto-construit de FunASR peut récupérer le coût du matériel en 3 à 6 mois.

Scénarios d'application de FunASR

  • Enregistrements de réunions et procès-verbaux intelligents : convertissez automatiquement l'audio des réunions d'entreprise en texte structuré avec des balises de haut-parleur et intégrez la base de connaissances RAG pour mettre en œuvre les « questions et réponses vocales ». Par rapport à la transcription manuelle, l’efficacité est augmentée de 10 à 20 fois.
  • Sous-titres vidéo et production de contenu : prend en charge l'exportation de sous-titres SRT/TSV, vitesse de traitement 170-340x en temps réel. Lorsque les opérations sur les nouveaux médias traitent par lots un corpus vidéo, la transcription peut être effectuée en 10 à 20 secondes environ pour une vidéo d'une heure.
  • Inspection de la qualité du service client et analyse émotionnelle : SenseVoice détecte automatiquement les états émotionnels des utilisateurs et les événements audio clés (tels que les querelles, les escalades de plaintes) et aide l'équipe d'inspection de la qualité à augmenter le taux de couverture des inspections aléatoires de 5 % à 100 %.
  • AI Voice Agent/Assistant : connectez-vous aux frameworks d'agent tels que Claude/Cursor/Dify via MCP Server ou OpenAI API pour fournir des capacités de saisie vocale locales pour les assistants IA et éviter la transmission externe de données vocales.
  • Transcription vocale médicale/financière/juridique : déploiement 100% privatisé, les données audio ne quittent pas l'intranet et répondent aux exigences de conformité HIPAA/MLI.

Ne correspond pas aux limites :

  • Pour les scénarios de communication en temps réel (tels que la transcription en temps réel lors de conférences téléphoniques), il est recommandé d'utiliser le point de terminaison de streaming Paraformer et d'optimiser le délai du premier mot.
  • Les très petites langues (telles que les langues africaines/amérindiennes) doivent être formées par elles-mêmes ou utiliser Qwen3-ASR, et la couverture peut être incomplète
  • Les scènes interactives qui nécessitent une latence de reconnaissance extrêmement élevée (<50 ms) nécessitent une optimisation personnalisée du streaming VAD et Paraformer.

Groupes applicables de FunASR

  • Développeurs d'applications IA : nécessité d'intégrer des fonctionnalités vocales dans les produits. FunASR fournit un SDK Python et une API compatible OpenAI, avec des coûts d'intégration extrêmement faibles. Remplace les services cloud ASR et permet d'économiser sur les frais d'API à long terme.
  • Enterprise AI Team : Dans les secteurs qui ont des exigences strictes en matière de confidentialité et de conformité des données (médicales, financières, juridiques), les capacités de déploiement privatisées de FunASR ont un besoin urgent. Il est recommandé de donner la priorité à l'évaluation de la sélection du modèle et de la planification du matériel.
  • Intégrateur de produits vocaux : ISV/SI qui ont besoin de personnaliser le pipeline ASR. L'architecture modulaire de FunASR permet le remplacement de n'importe quel composant et prend en charge les réglages fins.
  • Développeurs et chercheurs individuels : La licence MIT permet une utilisation gratuite et un développement secondaire, sans aucune restriction sur la recherche académique. Colab Quick Start vous permet de réaliser votre première tâche d'identification en 5 minutes.
  • Ne convient pas aux scénarios : Utilisation directe par des utilisateurs zéro code/non techniques, actuellement principalement interagis via Python/CLI/API, pas d'interface graphique ; Dans les scénarios qui nécessitent une utilisation SaaS prête à l'emploi de bout en bout, il est recommandé d'utiliser un package d'interface utilisateur tiers.

Résumé et perspectives de FunASR

FunASR est actuellement la boîte à outils de reconnaissance vocale de qualité industrielle la plus complète et la plus avancée de la communauté open source. Sa principale compétitivité réside dans la trinité « combinaison multimodèle + efficacité de raisonnement ultime + solution de déploiement à spectre complet » : les développeurs peuvent librement combiner des modèles ASR/VAD/ponctuation/séparation des locuteurs selon le scénario, atteindre un taux en temps réel 340x via vLLM et le déployer de n'importe quelle manière, comme Python SDK / OpenAI API / MCP / lama.cpp.

Limites actuelles :

  • Les documents et tutoriels sont encore principalement en anglais et en chinois, et les documents japonais/coréen sont en construction
  • Certains modèles (Fun-ASR-Nano) sont recommandés pour fonctionner sur GPU, le CPU est disponible mais SenseVoiceSmall doit être sélectionné
  • Les services WebSocket en temps réel doivent encore ajuster les paramètres pour un matériel spécifique dans des scénarios à forte concurrence

Évaluation des risques d'acquisition/adoption : FunASR est open source, gratuit et sous licence MIT, avec un risque d'adoption extrêmement faible. Avant le déploiement en entreprise, il est recommandé d'effectuer des tests de référence CER et RTF sur des données audio représentatives et de sélectionner la combinaison de modèles la plus appropriée (il est recommandé de commencer par SenseVoiceSmall pour vérification). Le risque de dépendance à long terme vient principalement de la continuité de la maintenance communautaire, mais l'investissement continu d'Alibaba Tongyi Lab et de ModelScope (une moyenne de 2 à 3 mises à jour de version par mois en 2025-2026) offre une bonne protection. Pour les entreprises qui ont besoin d’un support commercial, les produits de reconnaissance vocale Alibaba Cloud peuvent être considérés comme une alternative. Résumé : En tant que moteur ASR sous-jacent, FunASR est supérieur aux API cloud à source fermée et aux solutions auto-construites de Whisper en termes d'indicateurs techniques et de liberté de conformité, et constitue la boîte à outils open source préférée pour la couche d'infrastructure « parole-texte ».

Outils associés : , udio

Informations de version

  • v1.3.19 :Ajout d'une documentation de dépannage de longue session WebSocket en temps réel ; Améliorations de la sortie des sous-titres CLI SRT/TSV ; Le point de terminaison en temps réel piloté par le client prend en charge Fun-ASR-Nano.
  • v1.3.18 :La sortie des sous-titres CLI SRT/TSV utilise des horodatages de phrases pour écrire des invites de sous-titres segmentés.
  • v1.3.16 :Ajout d'un point de terminaison WebSocket en temps réel piloté par le client pour la reconnaissance de streaming sans VAD côté serveur.
  • v1.3.12 :Correction du code de langue Qwen3-ASR Correction de GLM-ASR Correction de vLLM repetition_penalty.
  • v1.3.3 :Ajout de la CLI funasr-server, de l'API compatible OpenAI, du serveur MCP pour les agents AI et du Dynamic VAD.

Avis des utilisateurs

  • Chargement des avis...