API Deepgram

-

Deepgram est la principale plate-forme API d'IA vocale du secteur, fournissant la reconnaissance vocale en temps réel (STT), la synthèse vocale (TTS), l'orchestration d'agents vocaux et l'analyse de l'intelligence audio via un ensemble unifié d'API. Le modèle Nova-3 prend en charge plus de 50 langues avec une latence de transcription inférieure à 300 ms ; le modèle conversationnel Flux a une détection de virage intégrée ; et la latence Aura-2 TTS est inférieure à 200 ms. La plate-forme est certifiée SOC 2, HIPAA, GDPR et les clients au niveau de l'entreprise incluent Twilio, Cloudflare, Sierra, etc.

API Deepgram Interface du produit

Une analyse complète de l'API Deepgram : Unifying Speech AI Infrastructure

Paramètres et statistiques de base

Dimensions Spécifications
Positionnement du produit Plateforme API d'IA vocale unifiée (STT/TTS/Voice Agent/Audio Intelligence)
Formulaire de livraison API Cloud (cloud public/cloud privé/auto-hébergé)
Modèle de base Nova-3 (Transcription universelle, plus de 50 langues), Flux (STT conversationnel, 10 langues), Aura-2 (TTS, plus de 40 langues en anglais)
Latence STT Diffusion en direct <300 ms (Nova-3), détection de virage intégrée Flux
Latence TTS Diffusion <200 ms (Aura-2)
Langues prises en charge STT 50+ langues, TTS principalement anglais (y compris plusieurs accents)
Conformité à la sécurité SOC 2 Type 1 & 2, HIPAA (signé BAA), GDPR, CCPA, PCI
Méthode de déploiement API de cloud public, cloud privé/VPC à locataire unique, auto-hébergement local
Organisation GitHub 658 abonnés, 115 référentiels, plus de 450 étoiles (SDK Python)
Entreprise créée 2015, dont le siège est à San Francisco, États-Unis
Statut de financement Achèvement de la série C de 130 millions de dollars en janvier 2026, évaluée à 1,3 milliard de dollars (licorne)
Dernière version 2026.07 — Flux Multilingue + API Voice Agent GA

Interprétation des paramètres : les principales barrières concurrentielles de Deepgram se reflètent dans trois « unifications » : une entrée d'API unifiée (une seule API d'agent vocal intègre STT/LLM/TTS), une infrastructure de streaming unifiée (STT et TTS partagent le même pipeline de streaming, réduisant les délais de prise de contact) et une solution de déploiement unifiée (la même API peut s'exécuter dans un cloud public, un cloud privé ou local). Cette conception architecturale permet de compresser le délai de liaison complète de l'interaction vocale de bout en bout à l'un des niveaux les plus bas du secteur. Pour les développeurs, cela signifie qu’il n’est pas nécessaire de regrouper trois systèmes indépendants STT, NLU et TTS entre plusieurs fournisseurs de services. Une clé API peut compléter le processus de l'entrée vocale à la sortie vocale.

Reconnaissance des utilisateurs et du marché

Couverture client au niveau de l'entreprise : la liste de clients de Deepgram comprend des entreprises leaders dans plusieurs secteurs, notamment Twilio (infrastructure de communication), Cloudflare (informatique de pointe), Sierra (agent IA d'entreprise), Cresta (intelligence du service client), Kore.ai (IA de dialogue d'entreprise), Daily (cadre de communication en temps réel), Vapi (plateforme d'agent vocal), Granola (notes de réunion), Jack in the Box (chaîne de restauration rapide), etc. médias, services financiers et autres domaines.

Communauté de développeurs : l'organisation GitHub compte 658 abonnés et le SDK officiel couvre Python (450 étoiles), JavaScript/TypeScript (268 étoiles), Go (87 étoiles), .NET (53 étoiles), Java (8 étoiles) et Rust (66 étoiles). La communauté est active dans les discussions Discord et GitHub, et la documentation technique officielle API Playground et la bibliothèque d'exemples de code sont fournies.

Reconnaissance du marché : en janvier 2026, elle a finalisé un financement de série C de 130 millions de dollars américains, avec une valorisation de 1,3 milliard de dollars américains et est entrée dans le camp des licornes, dirigé par des institutions d'investissement bien connues. Au cours de la même période, elle a acquis OfOne (une société d'IA vocale pour les restaurants drive-in), indiquant ainsi ses ambitions d'expansion dans des scénarios verticaux. Les médias industriels tels que Reuters, SiliconAngle et Forbes en ont parlé.

Avantage de coût

Développeur côté C/individuel

Deepgram offre 200 $ de crédit gratuit, et vous pouvez vous inscrire et l'utiliser sans lier de carte de crédit. Tous les points de terminaison du modèle public peuvent être utilisés dans le cadre du quota gratuit. Il convient aux développeurs individuels pour effectuer une vérification de prototypes, des expériences à petite échelle ou une intégration d'apprentissage.

API / Niveau Développeur

Le modèle de facturation est Pay-As-You-Go et prend en charge le pré-achat de forfaits annuels (plan de croissance, avec jusqu'à 20 % de réduction) :

Comparaison des prix de la reconnaissance vocale (STT) :

Modèle Paiement à l'utilisation (diffusion/minute) Croissance (streaming/minute) Pay-As-You-Go (préenregistré/heure) Croissance (préenregistrée/heure)
Flux Anglais 0,0065 $/min 0,0057 $/min 0,0077 $/min 0,0065 $/min
Flux Multilingue 0,0078 $/min 0,0068 $/min Comme ci-dessus Comme ci-dessus
Nova-3 Monolingue 0,0048 $/min 0,0042 $/min 0,0077 $/min 0,0065 $/min
Nova-3 Multilingue 0,0058 $/min 0,0050 $/min 0,0092 $/min 0,0078 $/min
Personnalisé Contacter les ventes Contacter les ventes Contacter les ventes Contacter les ventes

Fonctions supplémentaires STT : désensibilisation des informations sensibles (rédaction) 0,0020 $/min, amélioration des mots clés (invite de termes clés) 0,0013 $/min, séparation des locuteurs (diarisation) 0,0020 $/min ; Le formatage intelligent est inclus gratuitement.

Prix de la synthèse vocale (TTS) :

Modèle Paiement à l'utilisation Croissance
Aura-2 0,030 $/1 000 caractères 0,027 $/1 000 caractères
Aura-1 0,015 $/1 000 caractères 0,0135 $/1 000 caractères

Prix de l'API de l'agent vocal (tout compris) :

Forfaits Paiement à l'utilisation Croissance
Standard (pile complète Deepgram) 0,075 $/min (4,50 $/h) 0,068 $/min
Standard-BYO TTS 0,065 $/min 0,051 $/min
Personnalisé - BYO LLM + TTS 0,050 $/min 0,041 $/min
Avancé 0,163 $/min 0,146 $/min

Audio Intelligence : la génération de résumés de 0,0003 $ à 0,0006 $/1 000 jetons (entrée/sortie), la détection de sujets, l'analyse des sentiments et la reconnaissance d'intention sont inclus dans le prix.

Entreprise / Niveau de privatisation

La version entreprise est tarifée sur demande, veuillez contacter l’équipe commerciale pour confirmation. Prend en charge les fonctionnalités différenciées suivantes : formation de modèle personnalisé, déploiement de VPC à locataire unique, auto-hébergement local, signature HIPAA BAA, limites de concurrence plus élevées et SLA exclusif. Pour les scénarios d'utilisation intensive représentant en moyenne des dizaines de milliers d'heures d'audio par mois, les contrats d'entreprise bénéficient souvent de réductions supplémentaires sur le prix de croissance.

Conseil sur les coûts cachés : Deepgram ne facture pas de segments de silence et n'arrondit pas la durée audio, et le coût effectif réel peut être inférieur à celui prévu en fonction de la durée d'origine. Cependant, les fonctions supplémentaires (désensibilisation, amélioration des mots clés, séparation des locuteurs) sont facturées indépendamment, et lorsque plusieurs fonctions supplémentaires sont utilisées en combinaison, le coût de transcription unique sera considérablement augmenté.

Fonctions principales

  • Reconnaissance vocale en temps réel (Streaming STT) : en streaming audio via WebSocket, le modèle Nova-3 renvoie des résultats intermédiaires avec un délai inférieur à 300 ms et prend en charge la détection tour à tour et la segmentation automatique des phrases. Convient aux scénarios de conversation en temps réel qui nécessitent un retour à faible latence, tels que les assistants vocaux et le service client en ligne.

  • Transcription audio pré-enregistrée (STT pré-enregistrée) : l'API REST soumet des fichiers audio (prend en charge le multicanal). Nova-3 prend en charge plus de 50 langues et la vitesse de traitement par lots est jusqu'à 40 fois supérieure à celle des produits concurrents. Convient aux scénarios en temps différé tels que le podcasting, l'enregistrement de conférences et l'inspection de la qualité des centres d'appels.

  • Reconnaissance vocale conversationnelle (Flux) : Un modèle de reconnaissance spécialement conçu pour les agents vocaux, avec détection naturelle intégrée de la tournure de pensée (Détection de fin de pensée) et traitement des interruptions (Barge-in), sans recourir à des composants externes VAD (Détection d'activité vocale). Prend en charge 10 langues, avec des versions multilingues disponibles en juillet 2026.

  • Text to Speech (Aura-2 TTS) : synthèse vocale en streaming sur réseau neuronal, avec une latence inférieure à 200 ms, fournissant plus de 40 voix anglaises (y compris les accents américains, britanniques, australiens et autres), et prenant en charge la vitesse de parole et l'ajustement des émotions en fonction du contexte. Affinez votre style de prononciation grâce à la technologie Deepgram Prompting.

  • API Unified Voice Agent : une API unique intègre l'orchestration STT → LLM → lien complet TTS, prenant en charge BYO LLM (OpenAI, Anthropic, etc.) et BYO TTS. Appels de fonction intégrés, routage d'intention et changement de configuration dynamique dans les sessions. Prix ​​fixe 4,50$/heure tout compris.

  • Audio Intelligent Analysis : fournit une génération de résumés, une analyse des sentiments (mot/phrase/dialogue à trois niveaux), une reconnaissance d'intention et une détection de sujet basée sur des modèles spécialisés légers. Extrayez des informations structurées à partir de l’audio conversationnel sans faire appel à de grands modèles de langage coûteux à usage général.

  • Amélioration avancée de la transcription : la séparation des locuteurs (diarisation) marque automatiquement qui a parlé et quand ; formatage automatique de la ponctuation/des majuscules/des nombres (Smart Formatting) ; l'amélioration des mots clés (Keyterm Prompting) peut augmenter le taux de reconnaissance et de rappel des termes dans des domaines spécifiques jusqu'à 90 % ; la désensibilisation des informations sensibles (rédaction) supprime automatiquement les informations personnelles telles que les numéros de sécurité sociale et les numéros de carte de crédit ; La transcription des mots de remplissage (Filler Words) conserve les marques prononcées telles que « um » et « ah ».

Vue d'expert : Il existe des synergies significatives entre les gammes de produits Deepgram : la sortie de STT peut être utilisée comme entrée directe dans Audio Intelligence, et le résumé d'Audio Intelligence peut être utilisé comme entrée dans TTS pour la génération automatique de rapports vocaux. L'API Voice Agent connecte STT et TTS dans un pipeline de conversation vocale de bout en bout via la couche d'orchestration LLM, de sorte que les développeurs n'ont pas besoin de gérer séparément la synchronisation, le codec et la gestion des connexions du streaming audio. Cette capacité « acquisition-compréhension-génération » fait de Deepgram non seulement un ensemble d'API, mais un système d'exploitation complet d'IA vocale.

Evolution du modèle et de la version

Version principale

  • 2025.02 — Flux Conversational STT : Pour la première fois, la détection de virage est directement intégrée dans le modèle acoustique, disant adieu aux composants VAD indépendants traditionnels. Prend en charge une seule langue anglaise et est orienté vers des scénarios d'agent vocal en temps réel.
  • 2025.04 — Aura-2 TTS : modèle de synthèse vocale de réseau neuronal de deuxième génération, plus de 40 voix anglaises, latence <200 ms. Par rapport à Aura-1, la précision de la prononciation, le naturel et le traitement des termes professionnels (termes médicaux, termes financiers) ont été grandement améliorés.
  • 2026.01 — Nova-3 GA : Le modèle de transcription universelle de troisième génération est officiellement disponible dans le commerce. Par rapport à la génération précédente Nova-2, la reconnaissance des noms propres (tels que les noms de produits, les noms de personnes, les noms de lieux) a été considérablement améliorée. Avec Keyterm Prompting, la précision de la reconnaissance de termes spécifiques peut être augmentée de 10 % à plus de 90 %. Prend en charge plus de 50 langues et sa robustesse dans les environnements très bruyants a été considérablement améliorée.
  • 2026.06 — Flux Multilingual + Voice Agent API GA : Flux étendu à 10 langues (anglais/espagnol/allemand/français/hindi/russe/portugais/japonais/italien/néerlandais). L'API Voice Agent est officiellement commercialisée, marquant un nœud clé dans la transformation de Deepgram d'une API unique à une plate-forme d'IA vocale complète.
  • 2026.07 — Itération continue : les outils CLI, les spécifications de l'API de ressources auto-hébergées et d'autres infrastructures sont continuellement mis à jour, et 115 entrepôts sous l'organisation GitHub restent très actifs.

Vérification des candidats

Deepgram propose également un service de formation de modèles personnalisés, qui permet aux utilisateurs d'entreprise d'affiner le modèle Nova-3 sur la base d'ensembles de données propriétaires afin d'améliorer encore la précision de la reconnaissance des scènes périphériques. Ce service nécessite de contacter l'équipe commerciale pour évaluer le volume de données et les exigences du scénario.

Avantages techniques

Architecture d'apprentissage profond de bout en bout : Deepgram a adopté l'apprentissage profond de bout en bout (au lieu du modèle acoustique traditionnel + pipeline de modèle de langage) depuis sa création en 2015, et apprend directement le mappage des formes d'onde audio au texte via un seul réseau neuronal profond. L'avantage de cette architecture est qu'elle élimine la perte d'informations entre les modules du pipeline traditionnel et que le modèle peut utiliser plus pleinement les informations contextuelles à des fins d'inférence.

Infrastructure de streaming unifiée : STT et TTS fonctionnent sur la même infrastructure de streaming, partageant la gestion des connexions WebSocket, le codec audio et la planification du tampon de streaming. L'effet direct de ceci est que lorsque STT convertit l'audio en texte TTS, puis convertit le texte de réponse en voix, il n'est pas nécessaire de commuter les connexions réseau entre différents services intermédiaires et le délai de communication vocale de bout en bout est réduit au minimum.

Moteur à faible latence : la page produit affirme que les résultats intermédiaires de transcription en temps réel de Nova-3 peuvent être renvoyés en moins de 300 ms et que le premier octet audio d'Aura-2 peut arriver en moins de 200 ms. Les données mesurées (issues des commentaires publics du PDG de Phonely) montrent que la latence de bout en bout d'Aura-2 est généralement inférieure à 200 ms, ce qui est 2 à 4 fois plus rapide que celle des autres fournisseurs TTS traditionnels. Cette faible latence est essentielle pour les scénarios d'agents vocaux : l'oreille humaine peut percevoir une latence supérieure à 300 ms, en dessous de laquelle un rythme de conversation naturel peut être atteint.

Modèle de tâches spécialisées ou grand modèle à usage général : la fonction Audio Intelligence utilise de petits modèles légers et spécifiques à des tâches (plutôt que de grands modèles de langage à usage général) pour obtenir une précision de domaine plus élevée et des coûts de raisonnement inférieurs dans les quatre dimensions du résumé, de l'émotion, de l'intention et du sujet. La page produit indique clairement que ces modèles sont affinés sur les données de conversation de domaine et sont donc plus précis pour des tâches spécifiques (telles que la synthèse des conversations du service client) que les solutions LLM à usage général au coût similaire.

Topologie de déploiement flexible : API de cloud public → Cloud privé/VPC à locataire unique → Auto-hébergement local, couvrant tous les besoins de déploiement, de la vérification des prototypes à la stricte conformité des entreprises. La solution auto-hébergée est basée sur Docker/Kubernetes et fournit un Helm Chart complet et un script de déploiement (GitHub : ressources auto-hébergées, 39 étoiles).

Comment utiliser

Inscription et clé API

  1. Visitez console.deepgram.com pour créer un compte.
  2. Inscrivez-vous pour obtenir un crédit gratuit de 200 $, pas besoin de lier une carte de crédit.
  3. Créez une clé API dans la console et sélectionnez les autorisations requises (STT / TTS / Agent / Intelligence).
  4. Lancez une demande via l'API REST, WebSocket ou le SDK officiel.

Exemple d'appel rapide

Python : reconnaissance vocale en temps réel (WebSocket) :

à partir de Deepgram importer Deepgram
importer asyncio

dg_client = Deepgram('<VOTRE_CLÉ_API>')

async def transcribe_stream() :
    # Transcription en streaming en temps réel à l'aide du modèle Nova-3
    connexion = attendre dg_client.transcription.live(
        {"model": "nova-3", "langue": "en-US", "smart_format": True}
    )
    async def on_message(self, résultat, **kwargs) :
        print(result.channel.alternatives[0].transcript)
    connexion.on("transcript", on_message)

asyncio.run(transcribe_stream())

cURL : Transcription audio préenregistrée :

curl -X POST https://api.deepgram.com/v1/listen、model=nova-3&smart_format=true \
  -H "Autorisation : Jeton <VOTRE_API_KEY>" \
  -H "Type de contenu : audio/wav" \
  --data-binary @audio.wav

cURL : synthèse vocale (Aura-2) :

curl -X POST https://api.deepgram.com/v1/speak、model=aura-2-odysseus-en \
  -H "Autorisation : Jeton <VOTRE_API_KEY>" \
  -H "Type de contenu : application/json" \
  -d '{"text": "Bonjour, bienvenue dans l'IA vocale Deepgram."}' \
  --sortie discours.mp3

Configuration de l'API de l'agent vocal : connectez-vous à « wss://agent.deepgram.com/agent » via WebSocket et envoyez un message JSON contenant la configuration de l'agent (sélection LLM, mot d'invite système voix TTS) pour démarrer la session. Pour un exemple complet, consultez la Documentation officielle.

SDK disponibles

Deepgram fournit des SDK officiels : Python, JavaScript/TypeScript, Go, .NET, Java (une version communautaire de Rust est également disponible). Tous les SDK sont open source sur github.com/deepgram. De plus, l'outil CLI officiel prend en charge l'appel des fonctions intelligentes STT/TTS/audio directement depuis le terminal.

Prix des produits

Résumé du modèle payant :

Niveau Objets applicables Mode de paiement Conditions de départ
Quotas gratuits Développeur personnel, vérification de prototypes Bonus de 200 $ Inscrivez-vous pour obtenir
Paiement à l'utilisation Équipes petites et moyennes, applications en croissance Paiement à l'utilisation, sans minimum de consommation Changer automatiquement une fois le bonus épuisé
Croissance Applications à usage moyen à élevé Plan annuel en précommande (économisez 20%) 4 000 $+/an
Entreprise Utilisation massive, exigences de conformité, besoins de personnalisation Contacter le service commercial Confirmation d'affaires

Détails du crédit gratuit : crédit de 200 $ disponible pour tous les points de terminaison d'API publics (STT/TTS/Audio Intelligence/Agent). Les bonus non utilisés n'expirent pas. Il n'est pas nécessaire de lier une carte de crédit pour s'inscrire.

Limite de simultanéité : API REST STT sous simultanéité Pay-As-You-Go 50 WebSocket 150 ; Concurrence TTS 45 ; Concurrence de Voice Agent 45. Le package Growth est mis à niveau en conséquence vers REST 50, WSS 225, TTS 60 et Agent 60. Enterprise peut négocier une concurrence plus élevée.

Scénarios d'application

  • Contact Center and Customer Service Voice AI : transcrivez les conversations des clients et des agents en temps réel, combinez-les avec Audio Intelligence pour générer automatiquement des résumés d'appels, détecter les émotions des clients, identifier les intentions et classer par sujet. Les utilisateurs typiques incluent Stream It, Sharpen, Cresta, Revenue.io. Objectif de vérification : dans un environnement de centre d'appels bruyant, la robustesse de l'accent et du bruit du Nova-3 répond-elle aux exigences réelles en matière de taux de reconnaissance ; Keyterm Prompting peut-il couvrir le vocabulaire spécifique à l'entreprise.

  • Agent vocal et IA conversationnelle : créez un agent d'IA vocale de bout en bout basé sur l'API Voice Agent, qui peut être utilisé dans des scénarios tels que les commandes à emporter (Jack in the Box), le service client (Sierra, Aircall) et les rendez-vous médicaux. La détection de tour de rôle et la gestion des interruptions intégrées à Flux rendent l'expérience de conversation plus proche de l'interaction avec une personne réelle. Focus de vérification : en mode BYO LLM, le délai de réponse de LLM deviendra le goulot d'étranglement du délai de bout en bout ; il est nécessaire d'évaluer l'adéquation de la sélection LLM et du pipeline de streaming Deepgram.

  • Podcasting multimédia et sous-titrage vidéo : exploitez les capacités de traitement par lots à grande vitesse du STT préenregistré (jusqu'à 40x les taux en temps réel) pour générer des sous-titres et indexer la recherche de podcasts, de vidéos et de flux en direct. Combinés à la séparation des haut-parleurs et au formatage intelligent, les coûts de relecture manuelle sont considérablement réduits. Points clés de vérification : Si la précision de la diarisation dans les scénarios multi-enceintes répond aux normes de production ; pour le contenu multilingue, il est nécessaire de confirmer si la langue cible figure dans la liste prise en charge.

  • Documentation clinique médicale : permet la transcription en temps réel des conversations cliniques via l'API STT conforme à la HIPAA, prend en charge la terminologie médicale (améliorée avec Keyterm Prompting) et réduit la charge de travail administrative des médecins. La page produit Deepgram montre qu'un client dans le domaine vétérinaire (Talkatoo) a amélioré la précision de la reconnaissance des termes professionnels de 10 % à 625 % grâce à Nova-3. Points clés pour la vérification : Le BAA doit être signé ; la prise en charge de la terminologie médicale chinoise doit être vérifiée de manière indépendante.

  • Analyse vocale et intelligence d'entreprise : analysez les enregistrements du service client, les appels commerciaux et les enregistrements de réunions à grande échelle, et extrayez les tendances et les modèles grâce à Audio Intelligence. Comparé aux solutions LLM à usage général, le modèle spécialisé de Deepgram est 10 à 100 fois moins cher et convient à l'analyse audio à hauteur de millions de minutes par jour. Points clés de vérification : si l'exactitude du résumé/du sentiment/de l'intention répond aux besoins de la prise de décision commerciale ; s'il prend en charge un système de classification personnalisé.

Personnes concernées

  • Développeur d'applications vocales : ingénieurs back-end qui ont besoin d'API STT/TTS de haute précision et à faible latence pour créer des assistants vocaux, un service client vocal ou des produits d'IA conversationnelle. Le SDK de Deepgram couvre les langages courants, dispose d'une documentation complète et l'API Playground vous permet d'en ressentir les effets immédiatement. Prérequis : Avoir des capacités de programmation REST API ou WebSocket ; Un bonus de 200 $ suffit pour terminer la vérification MVP.

  • AI Agent Platform and Framework : les produits au niveau de la plate-forme tels que Vapi, Daily (Pipecat), Cognigy et Kore.ai intègrent les capacités vocales de Deepgram en tant que modules de leurs propres plates-formes. Les capacités BYO LLM de l'API Voice Agent permettent à ces plates-formes de conserver leur propre choix de modèles. Prérequis : Nécessite un contrat de niveau entreprise pour une concurrence plus élevée et des garanties SLA.

  • Centre de contact d'entreprise et responsable technique : décideur responsable des mises à niveau du système de service client, de l'analyse de la qualité des appels ou de l'introduction d'agents IA. Le système de conformité SOC 2/HIPAA/GDPR de Deepgram et l'intégration native avec Amazon Connect réduisent le seuil de risque pour les achats d'entreprise. Prérequis : les déploiements dans un cloud privé ou auto-hébergés nécessitent généralement une évaluation technique et un cycle PoC de 6 à 12 mois.

  • Nouveaux médias et créateurs de contenu : équipes de contenu ayant des besoins de synthèse vocale à haute fréquence (transcriptions de podcasts, compilation d'interviews, sous-titres vidéo). Transformez des heures d'audio en documents structurés en quelques minutes grâce au traitement par lots préenregistré et aux capacités de formatage intelligent de STT. Prérequis : Nécessite des outils d'accueil ou des scripts d'intégration auto-développés ; La prise en charge du chinois est disponible via Nova-3 Multilingual, mais la précision doit être mesurée.

  • Ne convient pas au grand public : projets nécessitant une transcription massive hors ligne (pas de dépendance au réseau) avec des budgets extrêmement faibles (il est recommandé d'envisager des solutions open source telles que Whisper) ; des scénarios TTS de haute qualité qui nécessitent l'utilisation de la synthèse vocale chinoise (la TTS actuelle de Deepgram est principalement en anglais, et la prise en charge de la voix chinoise n'a pas été divulguée et doit être soumise à des documents officiels) ; scénarios qui nécessitent un discours émotionnel expressif au niveau vidéo (tels que le doublage de personnages de jeu, des livres audio) - Aura-2 est destiné aux scènes de dialogue professionnelles plutôt qu'aux scènes de performance artistique.

Résumé et Outlook

La principale compétitivité de Deepgram réside dans la « livraison unifiée d'une IA vocale complète » : elle intègre les capacités STT, TTS et NLU qui étaient auparavant regroupées dans un ensemble d'API, et sur cette base, elle ajoute un moteur de streaming à faible latence, des modèles audio intelligents spécialisés et des options de déploiement flexibles. La sortie de Flux Multilingual et Voice Agent API GA au premier semestre 2026 marque la transition de Deepgram de « fournisseur d'API de reconnaissance vocale » à « plateforme de système d'exploitation d'IA vocale ».

Limites et incertitudes actuelles :

  • La diversité vocale de TTS est toujours principalement en anglais. La couverture et les effets d'application de la TTS multilingue n'ont pas été divulgués. Les clients des marchés non anglophones doivent confirmer la disponibilité.
  • Dans le mode BYO LLM de l'API Voice Agent, le délai de bout en bout est limité par la vitesse de réponse du LLM externe. Le prix officiel de 4,50 $/h donné par Deepgram suppose l'utilisation de sa configuration LLM recommandée.
  • Bien que la précision STT des langues asiatiques telles que le chinois soit prise en charge par Nova-3 Multilingual, il existe moins de données de référence publiques que l'anglais, les utilisateurs potentiels doivent donc effectuer de véritables tests de corpus.
  • Les besoins en ressources (modèle GPU, nombre de nœuds d'inférence) du déploiement auto-hébergé ne sont pas clairement indiqués sur la page publique. Vous devez contacter le service commercial pour obtenir des recommandations matérielles.
  • Le modèle de résumé/sentiment/intention d'Audio Intelligence ne prend actuellement pas en charge la formation personnalisée. Si une entreprise a des exigences de classification très verticales, elle peut avoir besoin de règles manuelles supplémentaires.

Évaluation des risques en matière d'approvisionnement et d'adoption :

  • Pour les petites et moyennes équipes, il est recommandé de commencer avec un quota gratuit de 200 $, de vérifier d'abord si les scénarios de base (précision STT, naturel TTS, latence de bout en bout) répondent à la base de référence de l'entreprise, puis de passer au plan de croissance si nécessaire.
  • Pour les achats au niveau de l'entreprise, trois éléments doivent être vérifiés via le PoC : ① Si la topologie de déploiement (cloud public vs cloud privé vs auto-hébergé) répond à la matrice de conformité ; ② La précision de l'identification des scénarios clés (en particulier le vocabulaire propriétaire et le contexte sonore) ; ③ Si le coût total de possession annuel respecte le budget (confirmez les frais de fonctionnalités supplémentaires, les coûts de pointe de simultanéité et les tarifs du support supplémentaire).
  • Faites attention au rythme d'itération du produit Deepgram (environ 2-3 mois pour une version majeure), et il est recommandé d'inclure des clauses de période de transition pour les mises à niveau de version et l'abandon d'API dans le contrat.

Outils associés : elevenlabs, udio

Informations de version

  • Flux Multilingue + API Voice Agent GA :Lancement du modèle de reconnaissance vocale conversationnelle multilingue Flux Multilingual (10 langues), l'API Voice Agent est officiellement disponible dans le commerce (4,50 $/h), le modèle Aura-2 TTS est en ligne et Nova-3 devient le modèle de transcription de production par défaut.
  • Disponibilité générale du Nova-3 :Le modèle Nova-3 est officiellement lancé, améliorant considérablement la précision de la reconnaissance des noms propres et du bruit, prenant en charge plus de 50 langues, Keyterm Prompting améliore le taux de rappel des mots clés jusqu'à 625 %
  • Lancement de la synthèse vocale Aura-2 :Lancement du modèle Aura-2 TTS, plus de 40 voix en anglais, latence inférieure à 200 ms, optimisé pour les scénarios de dialogue au niveau de l'entreprise
  • Lancement du STT conversationnel Flux :Lancement du modèle de reconnaissance vocale conversationnelle Flux, avec détection de virage et traitement d'interruption intégré, spécialement conçu pour les scénarios d'agents vocaux en temps réel

Avis des utilisateurs

  • Chargement des avis...