API AssemblyAI
API AssemblyAI
Paramètres de base et statistiques de l'API AssemblyAI
AssemblyAI n'est pas un produit de chat unique ou une application de bout en bout, mais un ensemble de collections d'API REST + WebSocket pour le lien complet du traitement vocal. Son objectif principal est un équilibre technique entre la précision de la transcription et la latence de traitement, et non le nombre de fonctionnalités. Le tableau suivant résume ses principales gammes de produits et spécifications :
| Gamme de produits | Formulaire API | Modèle de base | Unité de facturation | Latence typique |
|---|---|---|---|---|
| Synthèse parole-texte préenregistrée (STT préenregistrée) | API REST (asynchrone) | Universel-3.5 Pro, Universel-2 | Audio horaire | Durée du fichier × ~0,3-0,5 (facteur temps réel) |
| Conversion parole-texte en temps réel (STT en temps réel) | WebSocket (diffusion) | Universal-3.5 Pro en temps réel, diffusion universelle | Durée de la session WebSocket | 300-800ms Premier mot |
| API d'agent vocal | WebSocket unique (duplex intégral) | U3.5 Pro Temps Réel + LLM + TTS (cascade) | Séances par minute | ~500-1500 ms Réponse de bout en bout |
| Compréhension de la parole | REST (superposé sur la transcription) | Modèle d'analyse indépendant basé sur la post-transcription | Audio horaire (les fonctionnalités supplémentaires sont facturées par pièce) | Retours avec transcription |
| Garde-corps | REST/WebSocket | Modèle de modération indépendant | Audio horaire (les fonctionnalités supplémentaires sont facturées par pièce) | Retour avec transcription |
| Passerelle LLM | REST/WebSocket | 25+ modèles (OpenAI/Anthropic/Google/Qwen/Kimi) | jetons par million (entrée/sortie séparée) | Dépend du modèle sélectionné |
Limites du positionnement du produit : AssemblyAI ne fournit pas de système de service client de bout en bout, ne fournit pas de matériel d'enregistrement et ne fournit pas de plate-forme de formation PNL. Son ancre de valeur se trouve dans la couche de transformation « Entrée audio → Texte structuré/Intention/Métadonnées ». Si votre besoin est de « convertir des podcasts en texte et de les étiqueter », cela convient ; si vous avez besoin d'une plateforme complète de service client pour les agents de planification, ce n'est qu'un des modules.
Statut de la communauté et de l'industrie : selon des informations publiques, AssemblyAI a traité plus de 10 millions d'heures de données audio, au service de clients allant des développeurs indépendants aux entreprises Fortune 500. La société finalisera un financement de série C en 2022, avec un financement cumulé dépassant 115 millions de dollars américains. Les investisseurs incluent Insight Partners, Accel, etc. Les projets open source GitHub (tels que Python SDK, Go SDK, exemples de code) ont accumulé des milliers d'étoiles, mais leurs poids de modèle de base ne sont pas open source.
Reconnaissance des utilisateurs et du marché de l'API AssemblyAI
La position d'AssemblyAI sur le marché des API vocales se situe entre « des modèles open source purement académiques (tels que Whisper) » et des « plates-formes vocales cloud full-stack (telles que Azure Speech, Google Cloud Speech-to-Text) ». Ce avec quoi il est en concurrence n'est pas le nombre de modèles, mais la combinaison de « précision prête à l'emploi + expérience du développeur + préparation à la conformité ».
Niveau de développeur côté C/indépendant : un crédit gratuit de 50 $ et aucun processus d'enregistrement par carte de crédit abaissent considérablement le seuil d'expérience. Il est couramment utilisé par les développeurs indépendants pour la transcription de podcasts, la génération de sous-titres vidéo et les prototypes d'assistants vocaux personnels. Les discussions sur AssemblyAI sur Reddit et Hacker News se concentrent sur la « clarté de la documentation de l'API » et la « précision audio longue en chinois/multilingue » : dans les scénarios audio complexes en chinois, les utilisateurs ont signalé que sa précision était toujours à la traîne par rapport aux solutions locales telles que Alibaba Cloud ou Tencent Cloud, mais qu'elle était leader du secteur dans les scénarios anglais.
Côté B/niveau entreprise : la transcription médicale est le scénario vertical le plus compétitif d'AssemblyAI. Le mode médical (+0,15 $/h) est spécialement optimisé pour la terminologie médicale et combiné avec HIPAA BAA (pas de frais supplémentaires et pas besoin de signature de communication commerciale), ce qui lui permet d'être adopté de manière stable dans des scénarios tels que la télémédecine et la saisie vocale des dossiers médicaux électroniques. Le centre de service client (Contact Center) constitue le deuxième scénario d’adoption le plus important. La combinaison de transcription en temps réel + analyse des sentiments + révision du contenu couvre les trois besoins typiques de l'assistance des agents, de l'inspection de la qualité des appels et de la surveillance de la conformité. Les entreprises clientes divulguées publiquement comprennent un certain nombre de grandes sociétés de technologie médicale et des opérateurs de centres de service client externalisés.
Différence de positionnement avec les produits concurrents : Azure Speech et Google Cloud STT présentent des avantages en termes de couverture linguistique et d'intégration cloud native, mais AssemblyAI est plus compact en termes d'intégration de liens d'une « API unique pour compléter la transcription + compréhension + révision ». Whisper (OpenAI) offre une liberté dans les scénarios hors ligne et les réglages personnalisés, mais manque de streaming en temps réel, de séparation des haut-parleurs et de liaison conforme. Le point d'entrée d'AssemblyAI se situe juste entre les deux : plus axé sur la voix que les fournisseurs de cloud et plus prêt pour la production que les solutions open source.
Avantages financiers de l'API AssemblyAI
La structure de coûts d'AssemblyAI doit être évaluée en termes de « coût total de possession (TCO) » plutôt que de « prix par ligne ». Son prix unitaire n'est pas le plus bas, mais l'effet de packaging « transcription + compréhension + révision + conformité + exploitation et maintenance » peut réduire considérablement les coûts d'intégration technique dans certains scénarios.
Stratification compétitive des prix : la tarification d'AssemblyAI ne repose pas sur la logique de l'ère des grands modèles de « quelques centimes par million de jetons », mais est facturée sur une « base audio horaire ». Les différentes qualités de modèles présentent une différence de prix de 3 à 10 fois et des fonctions supplémentaires sont superposées à la facturation, formant un système de tarification capable de contrôler finement les frais.
| Éléments de facturation | Prix US/UE (identiques) | Instructions de facturation |
|---|---|---|
| Préenregistré - Universal-3.5 Pro | 0,21 $/h | Modèle phare, recommandé pour les transcriptions audio, médicales et critiques complexes |
| Préenregistré - Universal-2 | 0,15 $/h | Modèle universel, plus de 27 langues, adapté à la transcription par lots d'enregistrements clairs |
| Streaming - U3.5 Pro en temps réel | 0,45 $/h | La transcription phare en temps réel, facturée selon la durée de la session WebSocket |
| Streaming - Streaming universel | 0,15 $/h | Solution temps réel à faible coût, disponible uniquement en anglais ou multilingue |
| API d'agent vocal | 4,50 $/h (0,075 $/min) | Agent vocal de bout en bout (STT+LLM+TTS+orchestration), prix tout compris |
| Mode médical (supplémentaire) | +0,15$/h | Optimisation de la terminologie médicale, superposée au modèle de transcription |
| Modération du contenu (garde-corps) | +0,01$~0,15$/h | Désensibilisation du texte PII Coupe audio PII, modération du contenu pornographique/violent |
| Passerelle LLM | Facturation par token | Plus de 25 modèles allant de 0,05 $ à 5,00 $/M de jeton d'entrée |
Client/Développeur indépendant : le crédit gratuit de 50 $ est suffisant pour un projet de transcription de podcast de taille moyenne (~ 50 à 100 heures). Mais vous devez faire attention aux pièges de la facturation du streaming : le temps d'inactivité de WebSocket est également facturé, et une connexion dont la fermeture est oubliée peut consommer tout le quota gratuit en quelques heures. Aucune carte de crédit n'est requise pour l'inscription initiale et les appels API s'arrêteront une fois le quota gratuit épuisé, il n'y aura donc pas de factures inattendues.
Développeur/Intégrateur d'API : Le principal outil de contrôle des coûts est la sélection de modèles. La précision d'Universal-2 est suffisante dans des scénarios d'enregistrement clairs. Passer à Universal-3.5 Pro coûte 40 % de plus, mais l'amélioration de la précision se situe généralement entre 5 et 10 % - la clé est de savoir si votre scène se situe dans ces 5 à 10 %. Pour les scénarios bruyants, denses en terminologie médicale et dans lesquels plusieurs personnes parlent de manière superposée, le coût supplémentaire du modèle phare a un retour sur investissement positif. L'invite de termes clés (+0,05 $/h) peut améliorer le taux de reconnaissance de termes spécifiques sans mettre à niveau le modèle et constitue une méthode d'optimisation prioritaire dans les scénarios sensibles aux coûts.
Scénario Entreprise/Conformité : les certifications HIPAA BAA et SOC 2 sont incluses dans le prix standard sans frais supplémentaires, ce qui signifie que les secteurs de la santé et de la finance n'ont pas besoin de payer une « prime de conformité ». La certification PCI-DSS est limitée aux produits API Voice Agent. L'audio multicanal est facturé le double du nombre de canaux - le coût réel d'un fichier stéréo (2 canaux) est le prix catalogue × 2, qui doit être évalué à l'avance lorsqu'il s'agit d'enregistrements téléphoniques (généralement deux canaux : une piste pour l'agent + une piste pour le client).
Coûts cachés : le coût caché le plus important n'est pas les frais d'appel d'API, mais "les retouches causées par une mauvaise sélection de modèle". La documentation officielle indique clairement que les modèles par défaut (le paramètre Speech_models n'est pas explicitement défini) peuvent différer entre les comptes gratuits et payants, et que s'appuyer sur les valeurs par défaut peut entraîner des mutations dans le comportement de transcription après les mises à niveau. Un autre coût caché est la surfacturation provoquée par l’oubli de fermer la connexion en mode streaming – ce qui est différent de l’inertie des API à grand modèle qui facturent par token. Lorsque les équipes l’utilisent, elles doivent adapter le processus d’audit financier.
Principales fonctions de l'API AssemblyAI
La fonction d'AssemblyAI n'est pas de gagner sur la base du « nombre de fonctions », mais de construire des barrières basées sur « l'exhaustivité du lien entre l'entrée audio et la sortie structurée ». Ce qui suit détaille les fonctionnalités de base et leurs scénarios applicables par gamme de produits.
-
Discours en texte préenregistré (STT préenregistré) : prend en charge le téléchargement de fichiers audio/vidéo et renvoie les résultats de transcription de manière asynchrone. Les paramètres de base incluent
audio_url(pointant vers des fichiers audio),speech_models(sélection de modèles),langage_code(spécification de la langue ou détection automatique). Scénarios applicables : transcription de podcast, enregistrement de conférence en texte, génération de sous-titres vidéo, enregistrement de dictée médicale. Problèmes d'acceptation : La précision de la séparation des locuteurs et le taux de reconnaissance des termes de l'audio long chinois (> 60 minutes) doivent être vérifiés de manière indépendante sur l'ensemble de test. -
STT en temps réel : diffusez de l'audio via WebSocket, renvoyant des fragments de texte (énoncés) en temps réel. Prend en charge 3 modèles en temps réel et l'étiquetage des haut-parleurs en temps réel (U3.5 Pro Realtime prend en charge la séparation des haut-parleurs en ligne en temps réel à partir de mars 2026). Scénarios applicables : sous-titres en direct, transcription en temps réel des appels téléphoniques, couche d'entrée de l'agent vocal, enregistrement des réunions en temps réel. Problèmes d'acceptation : le délai du premier mot (TTFF) peut augmenter jusqu'à plus de 2 secondes dans un environnement réseau faible. L'impact de la gigue du réseau doit être évalué dans des scénarios mobiles.
-
API Voice Agent : officiellement publiée en avril 2026, complète la saisie vocale → la sortie vocale (STT → LLM → TTS) via un seul WebSocket. Détection de virage intégrée, gestion des interruptions et appel d'outil. Le prix est tout compris à 4,50 $/heure, éliminant le besoin de gérer séparément la facturation et l'intégration de trois fournisseurs de STT/LLM/TTS. Scénarios applicables : robot vocal du service client, présélection de consultation téléphonique, vérification de la qualification des appels sortants de vente. Limitation de base : la sélection de LLM est limitée par le pool de modèles disponible dans la passerelle LLM d'AssemblyAI. Si l’équipe a besoin d’accéder à son propre modèle affiné, elle doit créer un lien auto-construit.
-
Compréhension de la parole : superposez une couche d'analyse au-dessus des résultats de transcription, y compris l'identification du locuteur, la détection d'entités (plus de 50 types d'entités), l'analyse des sentiments (au niveau du paragraphe), les chapitres automatiques (obsolètes, recommandés pour être migrés vers LLM Gateway), les phrases clés, la détection de sujets (IAB), la traduction (plus de 100) langue cible), la synthèse (résumé, obsolète, recommandé pour migrer vers LLM Gateway). Scénarios applicables : analyse des appels du service client (extraction des points de fluctuation émotionnelle des clients, identification des problèmes à haute fréquence), résumé des réunions de vente (génération automatique des procès-verbaux des réunions et des actions à entreprendre), utilisation secondaire du contenu multimédia (extraction de fragments citables et classification des sujets à partir de podcasts).
-
Garde-corps (Content Security Guardrail) : effectuez simultanément des audits de sécurité au niveau de la couche de transcription - Désensibilisation des textes PII (remplacement automatique des numéros de carte de crédit, des numéros de sécurité sociale, des numéros de téléphone, etc.), mise au silence audio PII (couverture sonore de l'enregistrement original), filtrage des mots sensibles/contenus illégaux (filtrage des grossièretés), de la pornographie/violence/discours de haine et autres audits de contenu interdits (modération du contenu). Scénarios applicables : applications vocales pour mineurs, examen de la conformité des enregistrements du service client financier, filtrage du contenu des podcasts publics. Vue d'expert : les garde-corps et la transcription sont effectués dans le même appel d'API, sans avoir besoin de sections supplémentaires, ce qui signifie qu'il présente plus d'avantages en termes de latence et de coûts d'intégration que le lien « transcrire d'abord, puis réviser séparément ».
-
LLM Gateway : un nouveau produit lancé en avril 2026. Il s'agit essentiellement d'une couche de revente - utilisant la clé API d'AssemblyAI pour appeler uniformément plus de 25 modèles provenant de 5 fournisseurs, dont OpenAI, Anthropic, Google, Qwen et Kimi. Les fonctionnalités proposées incluent le basculement automatique (passe automatiquement à un modèle alternatif lorsqu'un modèle n'est pas disponible, sans ajouter de latence), la mise en cache des indices (prise en charge des modèles Anthropic/OpenAI/Google), la sortie JSON structurée (Claude 4.5+). Scénarios applicables : étape d'inférence LLM dans l'agent vocal, génération automatique de résumé après un appel, chaîne d'appel d'outil basée sur le contenu audio. Principales limitations : LLM Gateway ne fournit pas de services de réglage fin des modèles et ne prend pas non plus en charge l'accès aux modèles personnalisés.
Evolution du modèle et de la version de l'API AssemblyAI
L'évolution du produit AssemblyAI suit le rythme parallèle de « l'itération du modèle + l'expansion de l'API ». En termes de modèles, de Conformer-1 à Universal-3.5 Pro, les principaux changements se concentrent sur l'architecture de l'encodeur, l'échelle des données de formation et la couverture linguistique ; en termes d'API, il est passé de la transcription unique à la compréhension vocale Guardrails, Voice Agent et LLM Gateway, formant une matrice de produits couche par couche.
Gamme principale de modèles : de la série Conformer à la série Universal
- Conformer-1 (~2021) : premier modèle, basé sur l'architecture d'encodeur Conformer, avec une couverture limitée des scènes non anglaises telles que le chinois. Retraité et non recommandé pour les nouvelles intégrations.
- Conformer-2 (2023-11) : structure d'encodeur améliorée, précision de la transcription en anglais considérablement améliorée et prise en charge des fonctions de compréhension telles que la séparation des locuteurs et l'analyse des sentiments pour la première fois. Modèles actuellement disponibles mais non recommandés.
- Universel-2 (2024-06) : couverture linguistique étendue à plus de 27 langues, dont le chinois, le japonais, l'espagnol, l'allemand, le français et d'autres langues principales. Présentation du mécanisme d'invite de termes clés, permettant aux utilisateurs d'utiliser une liste de mots clés pour guider le modèle afin d'identifier des termes spécifiques. Il se positionne comme le modèle principal de transcription générale, et présente un gradient de prix avec le modèle phare.
- Universal-3.5 Pro (2025-03) : Modèle phare préenregistré, la précision est nettement supérieure à Universal-2 dans les scènes audio difficiles telles que les situations bruyantes, les conversations à plusieurs personnes, la parole rapide et les accents. La version streaming (Universal-3.5 Pro Realtime) a été lancée simultanément et est devenue le modèle de saisie préféré des agents vocaux. Il est recommandé que les nouvelles intégrations utilisent ce modèle par défaut.
Étapes d'expansion de la gamme de produits API
- 2024 et avant : avec le STT préenregistré et le streaming STT comme noyau, la compréhension vocale comme fonctionnalité supplémentaire. Le modèle commercial est un pur paiement à l’utilisation par API.
- 2025 : La gamme de produits Guardrails sera lancée de manière indépendante, intégrant la désensibilisation des informations personnelles, la révision du contenu et le filtrage des mots sensibles. Le mode médical est officiellement pris en charge et couvre les scénarios de transcription médicale. La tarification s'affine dans le sens "modèle de base + fonctions supplémentaires facturées pièce par pièce".
- Avril 2026 : L'API Voice Agent est officiellement publiée (renommée et mise à niveau par rapport à l'API Speech-to-Speech d'origine) et LLM Gateway est lancée simultanément. Les deux nouveaux produits étendent le positionnement d'AssemblyAI de « parole vers texte » à « routage voix vers parole + LLM pour les flux de travail vocaux ».
Chemins de dépréciation et de migration remarquables
- Les alias de modèles « meilleur » et « nano » sont obsolètes et correspondent respectivement à Universal-3.5 Pro et Universal-2.
- Le paramètre
speech_model(singulier) est obsolète, utilisez plutôtspeech_models(pluriel). - Les fonctions
auto_chaptersetsummarizationrenverront silencieusement 500 erreurs sur Universal-3.5 Pro, et il est officiellement recommandé de migrer vers LLM Gateway (génération de résumés de chapitre et de résumés via Claude Sonnet ou la série GPT-5). - L'alias du modèle de streaming
u3-proa été mappé suru3-rt-pro, les nouvelles intégrations doivent utiliser le nom standard.
Avantages techniques de l'API AssemblyAI
La feuille de route technique d'AssemblyAI s'articule autour de l'objectif « d'atteindre la plus grande précision de transcription sur le matériel GPU standard », plutôt que de simplement rechercher le nombre de paramètres de modèle ou l'étendue de la couverture linguistique.
Orientation pratique de l'architecture de l'encodeur : contrairement aux modèles open source tels que Whisper qui utilisent un transformateur encodeur-décodeur pur, la série Conformer d'AssemblyAI combine des modules de convolution (CNN) et d'auto-attention (Self-Attention) dans l'encodeur. L'avantage de cette architecture hybride est que le module de convolution peut capturer efficacement les modèles de synchronisation locaux dans l'audio (tels que les transitions phonémiques), tandis que l'auto-attention est efficace pour modéliser les dépendances globales. Cette architecture est plus robuste au bruit, aux accents et aux inflexions dans des scénarios réels que les encodeurs Transformer purs, ce qui entraîne un taux d'erreur de mot (WER) inférieur de 10 à 20 % dans des contextes bruyants.
Philosophie de conception du flux de contrôle en cascade : L'architecture réelle de l'API Voice Agent est STT (Universal-3.5 Pro Realtime) → LLM (Routage de passerelle) → TTS (LiveKit auto-hébergé), mais elle est exposée à l'extérieur en tant que point de terminaison WebSocket unique. La différence entre cette solution en cascade et le modèle vocal de bout en bout (tel que le mode vocal natif de GPT-4o) est que les produits intermédiaires de chaque couche (texte de réponse LLM de transcription de texte) peuvent être audités et débogués. Cette architecture en cascade auditable est irremplaçable pour les scénarios de conformité tels que la finance et la santé qui nécessitent des « résultats intermédiaires explicables de l'IA ».
Ingénierie à faible latence pour la transcription en temps réel : le principal défi technique du STT en temps réel est de « comment produire une sortie lisible avant l'arrivée du contexte complet ». L'approche d'AssemblyAI consiste à commencer le décodage dès l'arrivée du premier audio de 100 à 200 ms, à utiliser un algorithme d'alignement local pour générer un énoncé temporaire, et à corriger et affiner en permanence lorsque l'audio suivant arrive. Cela signifie que le délai du premier mot peut être contrôlé entre 300 et 800 ms, mais que le premier mot de sortie peut être corrigé une fois le contexte amélioré. Pour les scénarios de sous-titres en temps réel, cette stratégie « d'abord sortir puis changer » est plus utilisable que « attendre que tout soit traité puis sorti ».
Sélection de solutions techniques pour la séparation des haut-parleurs : AssemblyAI propose deux niveaux de séparation des haut-parleurs : la version standard (+0,02 $/h, basée sur le regroupement des fonctionnalités audio) et la version expérimentale (+0,065 $/h, en utilisant un modèle d'intégration plus raffiné). La version standard est suffisante pour des conversations claires entre 2-3 personnes, mais la version expérimentale montrera des améliorations significatives lorsqu'il y a plus de 4 haut-parleurs ou lorsque l'audio présente de nombreux chevauchements. La séparation des locuteurs en temps réel prendra en charge l'annotation en ligne de U3.5 Pro Realtime après mars 2026, ce qui constitue une exigence stricte pour les scénarios d'agent vocal : sans étiquettes de locuteur en temps réel, l'agent ne peut pas faire la distinction entre « ce que le client a dit » et « ce que l'agent a dit ».
Comment utiliser l'API AssemblyAI
AssemblyAI n'a pas d'application de bureau GUI ni d'application mobile, toutes les fonctionnalités sont exposées via l'API REST et l'API WebSocket. Le parcours d'utilisation est divisé en trois étapes : « Expérience de la page produit → Intégration API → Déploiement en production ».
Portail d'expérience produit : le site officiel propose une page Playground, où vous pouvez télécharger des fichiers audio pour tester l'effet de transcription, changer de modèle et ajuster les paramètres sans écrire de code. C'est la manière la plus directe d'évaluer la précision. Il est recommandé de tester 10 à 20 échantillons audio de votre propre scène avant d'acheter.
Étapes d'intégration de l'API :
- Enregistrez un compte AssemblyAI et obtenez une clé API. Inscrivez-vous et obtenez automatiquement 50 $ de crédit gratuit, aucune carte de crédit requise.
- Sélectionnez une gamme de produits : la transcription préenregistrée utilise REST POST pour soumettre l'URL audio, la transcription en direct ouvre une connexion WebSocket et Voice Agent utilise le point de terminaison Agent WebSocket.
- Paramètres de requête clés :
audio_url(préenregistré) / URL WebSocket (en temps réel),speech_models(spécifiez explicitement le modèle, ne vous fiez pas à la valeur par défaut),lingual_code(spécifiez la langue ou laissez-le vide pour une détection automatique), paramètres de fonction supplémentaires (tels quespeaker_labels: truepour activer la séparation des locuteurs). - Réception des résultats : le mode pré-enregistrement obtient les résultats via un rappel (webhook) ou une interrogation ; le mode temps réel reçoit en permanence les événements d'énoncé sur WebSocket ; Voice Agent envoie et reçoit des données vocales sur le même WebSocket.
Exemple d'appel API (SDK Python) :
importer l'assemblyai en tant qu'aai
aai.settings.api_key = "<VOTRE_CLÉ_API>"
# Transcription préenregistrée
transcripteur = aai.Transcribe()
config = aai.TranscriptionConfig(
Speech_model=aai.SpeechModel.best, # Mapper automatiquement vers Universal-3.5 Pro
speaker_labels=Vrai,
code_langue="zh"
)
transcription = transcriber.transscribe("https://example.com/audio.mp3")
imprimer (transcription.text)
# Transcription en temps réel (WebSocket)
transcripteur = aai.RealtimeTranscribe(
taux_échantillon = 16 000,
on_data=énoncé lambda : print(utterance.text),
on_error=erreur lambda : print(erreur)
)
transcripteur.connect()
Remarques d'intégration :
- La facturation du streaming est basée sur la durée de connexion WebSocket plutôt que sur la durée audio. Assurez-vous de fermer la connexion immédiatement après la fin du flux audio.
- L'audio multicanal est facturé par canal × durée. Veuillez confirmer si vous devez conserver toutes les chaînes avant de les télécharger.
- La sélection du modèle par défaut peut différer entre les comptes gratuits et payants, définissez toujours explicitement le paramètre
speech_models.
Prix des produits pour l'API AssemblyAI
AssemblyAI adopte un modèle de tarification de « démarrage de quota gratuit + paiement à l'utilisation + superposition de fonctions supplémentaires ». Il n'y a pas d'offres publiques pour les forfaits d'abonnement ou les remises annuelles, les remises sur volume pour les entreprises nécessitent de contacter le service commercial.
Quota gratuit : Inscrivez-vous et obtenez 50 $ de temps de traitement gratuit, aucune carte de crédit requise. Le niveau gratuit a une limite de simultanéité de 5 nouvelles connexions de streaming par minute, qui augmente à 100 par minute lors de la mise à niveau vers le paiement à l'utilisation (PAYG).
Structure de facturation au fur et à mesure :
- Transcription préenregistrée : facturée selon la durée (heure) de soumission audio, multicanal selon le nombre de canaux × durée. Des fonctionnalités supplémentaires (séparation des locuteurs, détection d'entités, analyse des sentiments, etc.) s'accumulent jusqu'à 0,01 $ à 0,15 $/h chacune.
- Transcription en temps réel : Facturée selon la durée de la session WebSocket (de la connexion à la déconnexion), et non selon la durée de l'envoi audio. Des fonctionnalités supplémentaires s’empilent également.
- API Voice Agent : facturée à la minute de session, 0,075 $/min (4,50 $/h), tous les composants (STT+LLM+TTS+orchestration) inclus.
- Passerelle LLM : Facturé par jeton d'entrée/sortie de modèle, chaque modèle est tarifé indépendamment, allant de 0,05 $/M de jeton d'entrée (GPT-5 Nano) à 5,00 $/M de jeton d'entrée (GPT-5.5 / Claude 4.8 Opus).
Pièges de facturation courants :
- Facturation continue des connexions inactives WebSocket - Oublier de fermer une connexion est la plus grande source de dépenses imprévues.
- L'utilisation des fonctionnalités obsolètes « auto_chapters » ou « summarization » sur Universal-3.5 Pro non seulement ne fonctionnera pas, mais entraînera également des coûts de gestion des erreurs et de temps de débogage.
- Le prix du modèle de LLM Gateway est divisé en routage global (mondial) et routage régional (dans la région). Le prix du routage régional est 10 % plus élevé - si des restrictions de souveraineté des données ne sont pas requises, la spécification explicite de ""model_region": "global"` peut permettre d'économiser 10 % du coût de l'appel LLM.
Scénarios d'application de l'API AssemblyAI
Les capacités d'AssemblyAI couvrent deux dimensions : le « traitement par lots hors ligne » et « l'interaction en ligne et en temps réel ». Les trois types de scénarios suivants sont les plus représentatifs.
-
Transcription médicale et saisie vocale des dossiers médicaux : le mode médical (+0,15 $/h) est spécifiquement optimisé pour la terminologie médicale (noms de médicaments, vocabulaire anatomique, critères de diagnostic), combiné à la conformité HIPAA BAA (aucun frais requis pour signer), permettant aux cliniques et aux hôpitaux de créer des systèmes de saisie de dossiers médicaux électroniques à commande vocale. Lien typique : dictée du médecin → transcription en temps réel → optimisation du mode médical → extraction des champs du dossier médical structuré. Avantages de déduction : en libérant les médecins de la saisie manuelle, on estime que chaque médecin économisera 45 à 90 minutes de temps de travail par jour. Conditions préalables à la mise en œuvre : les scénarios médicaux chinois doivent d'abord utiliser des échantillons pour tester l'exactitude du mode médical : l'exactitude de la transcription médicale en anglais a atteint un niveau utilisable en production, et il y a moins de données publiques pour la transcription médicale chinoise, ce qui nécessite des tests d'acceptation plus adéquats.
-
Analyse des appels du centre de service client et assistance de l'agent : la combinaison de transcription en temps réel + analyse des sentiments + examen du contenu couvre trois sous-scénarios en même temps : pendant l'appel (l'écran de l'agent affiche les sautes d'humeur du client et les invites de mots clés en temps réel), après l'appel (génère automatiquement des résumés d'appel, identifie les problèmes à haute fréquence et extrait les tâches à effectuer) et l'audit de conformité (vérifie si l'agent a utilisé des mots sensibles et si le client a autorisé les informations nécessaires). Avantages de déduction : augmentez le taux d'échantillonnage des appels de l'équipe d'inspection qualité de 5 à 10 % (limite manuelle) à 100 % (examen automatique par IA), tout en raccourcissant le cycle de formation des agents de 20 à 30 %. Conditions préalables : L'effet de doublement des coûts de l'enregistrement des appels sur deux canaux doit être inclus dans le TCO. La précision des invites de mots clés dépend de la qualité de la configuration des invites de mots clés.
-
Voice Agent/Voice Robot : l'API Voice Agent fournit le chemin le plus rapide « de zéro à un agent vocal conversationnel ». Les applications typiques incluent : les visites de rappel automatiques pour les plats à emporter/la logistique, les rappels de remboursement bancaire et de carte de crédit, ainsi que la confirmation et la reprogrammation de rendez-vous ambulatoires. Avantages de déduction : par rapport aux appels sortants manuels, le coût d'un seul appel est passé d'environ 5 à 10 yuans (main-d'œuvre) à environ 0,45 yuan (4,50 $/heure de l'API Voice Agent est d'environ 0,1125 $ ≈ 0,8 yuan pour un appel de 1,5 minute, ce qui est toujours inférieur au coût de la main-d'œuvre après avoir ajouté les frais de ligne de l'opérateur). Conditions préalables à la mise en œuvre : Voice Agent est actuellement mature dans les tâches simples de questions/réponses et de confirmation d'informations, mais lorsqu'il implique plusieurs cycles de raisonnement d'intention complexe (comme la remontée des plaintes des clients, un service après-vente complexe qui nécessite une intervention manuelle), des agents artificiels doivent encore être mis en place.
Groupes applicables de l'API AssemblyAI
-
Développeurs indépendants et équipes technologiques de start-up : 50 $ de crédit gratuit + documentation API claire + SDK multilingue (Python, JavaScript, Go, Ruby, .NET), ce qui en fait l'un des premiers choix pour le prototypage vocal. Ne convient pas aux limites : si le projet nécessite une transcription hors ligne (pas de contexte Internet) ou nécessite des modèles profondément personnalisés (réglage/distillation), le mode API pur d'AssemblyAI ne peut pas répondre aux exigences, et des solutions open source telles que Whisper doivent être envisagées.
-
Ingénieur back-end d'applications vocales : une équipe back-end qui doit traiter la transcription de fichiers audio et vidéo et créer des pipelines vocaux en temps réel. L’avantage d’AssemblyAI est qu’une seule clé API peut connecter l’ensemble du lien transcription → compréhension → révision, réduisant ainsi les frais d’ingénierie de l’intégration multi-fournisseurs. Prérequis : L'équipe doit avoir une expérience en programmation WebSocket. La logique de facturation du mode temps réel (durée de connexion au lieu de durée audio) est différente de la pensée de l'API REST, il faut donc prêter attention à la conception et à la pré-production.
-
Équipe technologique de conformité pour les secteurs de la santé et de la finance : la couverture standard des certifications HIPAA BAA et SOC 2, ainsi que la certification PCI-DSS pour l'API Voice Agent, minimise les frais d'ingénierie du chemin de conformité. Ne convient pas aux frontières : si les exigences réglementaires exigent que les données soient stockées sur des serveurs nationaux (Chine), AssemblyAI ne fournit actuellement des services que dans les régions des États-Unis et de l'UE et n'est pas déployé en Chine. La faisabilité de la conformité de la transmission transfrontalière de données doit être évaluée.
-
Équipe de production média et contenu : Transcription de podcasts, génération de sous-titres vidéo, archivage des enregistrements de réunions. La précision de l'Universal-2 dans les enregistrements clairs est suffisamment adéquate pour que vous n'ayez pas besoin de payer le supplément d'un modèle phare pour des scènes simples. Prérequis : un certain degré de travail de script ou d'intégration est requis (comme la soumission automatique de fichiers audio à AssemblyAI via Zapier ou des scripts auto-construits et la récupération des résultats de transcription), et les personnes non techniques peuvent avoir besoin de s'appuyer sur des packages d'outils tiers.
Résumé et perspectives de l'API AssemblyAI
La principale compétitivité d'AssemblyAI réside dans le « niveau API de l'ensemble du lien de traitement vocal » - ce n'est pas la solution avec la plus grande précision vocale (dans des langages et des scénarios spécifiques, les fournisseurs de cloud locaux ou des modèles affinés pour un corpus spécifique peuvent être meilleurs), mais il offre une option de commercialisation au niveau de la production basée sur l'équilibre triangulaire « précision prête à l'emploi + préparation à la conformité + efficacité de l'intégration technique ».
Limitations actuelles majeures :
- Il n'y a pas de nœud de service en Chine. Pour les entreprises en Chine, la transmission transfrontalière de données audio est confrontée à une incertitude en matière de conformité. Il ne s’agit pas d’une question technique, mais d’une question d’accès qui nécessite une évaluation juridique.
- La précision des langues non anglaises telles que le chinois est toujours à la traîne par rapport à l'anglais. Bien qu'elles continuent de s'améliorer, les capacités de traitement de l'audio complexe chinois (dialectes, ambiguïtés homonymes, termes professionnels) n'ont pas encore atteint les niveaux de l'anglais, et un PoC pré-acheté pour les scénarios chinois est indispensable.
- La sélection LLM de Voice Agent (Voice Agent API) est limitée par le pool de modèles de Gateway. Si vous devez utiliser votre propre modèle affiné ou un modèle spécifique non collecté, vous ne pouvez actuellement utiliser que le lien STT+LLM+TTS auto-construit, ce qui perdra la commodité du prix tout compris WebSocket unique et de la certification PCI.
Évaluation des risques d'approvisionnement et d'adoption : pour les équipes ayant des besoins en matière de traitement vocal en anglais, AssemblyAI est une option à faible risque pour « valider d'abord et développer plus tard » : le crédit gratuit de 50 $ est suffisant pour compléter la preuve de concept, et aucun contrat annuel ni paiement initial n'est requis. Le chemin d'évaluation recommandé est le suivant : utilisez d'abord un crédit gratuit de 50 $ pour tester 20 à 50 audios représentatifs sur le Playground → Confirmez que la précision répond à la norme → Contactez le service commercial pour négocier une remise lorsque l'utilisation dépasse 500 $/mois → Dans le scénario Voice Agent, utilisez d'abord le prix tout compris de 4,50 $/h pour vérifier l'adéquation du produit au marché, puis décidez s'il convient de migrer vers un lien auto-construit pour contrôler les coûts. Pour les affaires en Chine, avant qu'AssemblyAI n'entre officiellement en Chine ou ne coopère avec des fournisseurs de services cloud locaux, il est recommandé de le surveiller mais de ne pas en faire la solution principale pour le moment.
Outils associés : elevenlabs, udio
Informations de version
- API AssemblyAI (version 2026-07) :Universal-3.5 Pro est le dernier modèle de transcription phare, l'API Voice Agent a atteint le stade officiellement disponible et LLM Gateway a ajouté plus de 25 modèles et un basculement automatique. L'itération de la version spécifique est soumise au journal des modifications officiel.
- API AssemblyAI (version 2026-04) :L'API Voice Agent est officiellement publiée (anciennement API Speech-to-Speech) et LLM Gateway est en ligne, prenant en charge plus de 25 modèles de 5 fournisseurs. Il n’y a pas encore de date officielle précise.
- API AssemblyAI (version 2025-12) :Universal-Streaming Multilingual est lancé, prenant en charge la transcription multilingue en streaming en temps réel ; Universal-3.5 Pro lance la version streaming. Il n’y a pas encore de date officielle précise.
- API AssemblyAI (version 2025-03) :Le modèle Universal-3.5 Pro est lancé, améliorant considérablement la précision de la transcription d'audio complexes (conversations bruyantes à plusieurs personnes). Il n’y a pas encore de date officielle précise.
- API AssemblyAI (version 2024-06) :Le modèle Universal-2 est lancé, remplaçant le précédent Conformer-2, couvrant plus de 27 langues, et sert de modèle principal pour la transcription universelle. Il n’y a pas encore de date officielle précise.
- API AssemblyAI (version 2023-11) :Le modèle Conformer-2 a été lancé, introduisant une architecture d'encodeur améliorée et devenant le modèle de transcription phare à l'époque. Il n’y a pas encore de date officielle précise.
Avis des utilisateurs