Flux de dialogue Google Gratuit

-

Google Dialogflow est une plate-forme NLU entièrement gérée qui fournit des agents prédéfinis, une prise en charge multilingue et une intégration multicanal pour créer rapidement un service client et des assistants conversationnels.

Flux de dialogue Google Interface du produit

GoogleDialogflow

Paramètres et statistiques de base

Paramètres Dialogflow ES Dialogflow CX
Positionnement du produit Moteur de conversation NLU léger Plateforme d'orchestration de flux de conversations au niveau de l'entreprise
Modèle de dialogue Correspondance intention-entité traditionnelle Flux + Page + Machine à états d'état
Dialogue multi-tours Gestion du contexte de base Machine à états avancée + condition de branchement + saut conditionnel
Prise en charge multilingue 30+ langues 30+ langues
Canaux intégrés Plus de 20 chaînes prédéfinies Plus de 20 chaînes prédéfinies + extensions Webhook
Collaboration des agents Non pris en charge Appel d'agent à agent pris en charge
Repli génératif Assistance (limitée) Support (intégration profonde)
ANS 99,95 % (version ES) 99,95 % (version CX)
Formulaire de déploiement Entièrement géré (Google Cloud) Entièrement géré (Google Cloud)

Dialogflow propose deux gammes de produits : ES (Essentials) est le produit de première génération après l'acquisition d'API.ai par Google. Il adopte le paradigme de correspondance intention-entité et convient aux scénarios avec des besoins déterminés et des chemins simples ; CX (Customer Experience) est une nouvelle architecture lancée en 2020, qui introduit une machine à états de page et une orchestration de flux visuel, orientée vers des conversations complexes à plusieurs tours. Les deux partagent le moteur NLU et la couche d'intégration de canal, mais il existe des différences fondamentales dans le modèle de gestion des conversations : ES est une imbrication linéaire, CX est une structure graphique et le coût de maintenance de ce dernier est nettement inférieur à celui du premier lorsque les combinaisons de branches explosent.

La véritable limite des capacités multilingues : bien qu'il prétende officiellement prendre en charge plus de 30 langues, la précision NLU de chaque langue n'est pas cohérente. L'anglais, le japonais, l'allemand, le français et d'autres langues dans lesquelles Google est profondément impliqué sont les plus performants ; La reconnaissance des intentions chinoises dans les domaines généraux peut répondre aux besoins de production, mais dans des scénarios avec des termes industriels denses (tels que médicaux et juridiques), la précision de la reconnaissance des petites langues​​et des langues minoritaires​​diminuera considérablement. Lors du choix d’un déploiement multilingue, il est recommandé de donner la priorité à la vérification des tests A/B dans la langue cible.

Conditions supplémentaires au SLA : 99,95 % du SLA s'applique à l'environnement de production pour la version CX et 99,9 % pour la version ES. La compensation SLA de Google Cloud est restituée sous forme de points de service. Aucune compensation en espèces n'est fournie et le temps d'indisponibilité causé par la qualité des données de formation du client, les dépassements de quota ou les défauts de conception du modèle est exclu. Pour les entreprises qui intègrent Dialogflow dans leurs processus de service client de base, il est recommandé d'évaluer « si le plafond de compensation du SLA couvre les pertes liées aux interruptions d'activité ».

Reconnaissance des utilisateurs et du marché

La position de Dialogflow sur le marché repose sur la couverture du canal côté B de l'écosystème Google Cloud et sur la réputation des développeurs accumulée au cours de la période API.ai, mais son échelle exacte d'utilisateurs et la transparence publique des cas d'entreprise sont limitées.

Statut d'adoption côté B : Dialogflow était anciennement connu sous le nom d'API.ai, créé en 2010 et acquis par Google en 2016. Il s'agit de l'un des produits d'IA conversationnelle les plus anciens de Google Cloud. Selon des informations publiques, CX compte des centaines de cas de déploiement dans des entreprises Fortune 500, couvrant des secteurs tels que la vente au détail, la finance, les télécommunications, la médecine et le tourisme - HSBC Telstra et KLM sont ses clients de référence. Cependant, Google ne continue pas à divulguer des indicateurs de base tels que le nombre total de clients, les utilisateurs actifs mensuels ou le chiffre d'affaires annuel.

Communauté de développeurs : Dialogflow dispose d'un référentiel SDK officiel (Node.js/Python/Java/C#/PHP) sur GitHub, et son activité écologique est inférieure à celle d'étoiles montantes telles que l'API OpenAI. Il y a environ 20 000 questions balisées sur Stack Overflow, et la proportion de questions sur la version CX continue d'augmenter. Google Cloud fournit officiellement Codelab et Qwiklabs, mais les cours tiers et les plug-ins communautaires sont relativement rares.

Évaluation du secteur : dans le Magic Quadrant Gartner 2024 pour Enterprise Dialog AI, Google (Dialogflow) a été nommé l'un des leaders (à égalité avec AWS Lex et Microsoft Nuance). Les critiques ont loué ses capacités multilingues et la profondeur de l'intégration de Google Cloud, mais ont noté la courbe d'apprentissage de l'interface utilisateur de CX et le manque de prise en charge des contextes non Google Cloud. Dans l'évaluation Forrester Wave, Dialogflow est en tête en termes de précision NLU et de couverture multicanal, mais est inférieur aux produits concurrents dans la dimension « configuration libre-service pour les utilisateurs non techniques ».

Différence de positionnement sur le marché avec les produits concurrents : par rapport à AWS Lex (axé sur les chaînes d'outils de développement), Azure Bot Service (axé sur l'intégration d'Office 365) et Nuance (axé sur les scénarios médicaux et vocaux), la principale différenciation de Dialogflow est qu'il n'est pas lié à un seul écosystème cloud. Bien qu'il soit hébergé sur Google Cloud, il peut être déployé sur Slack, Twilio, Telegram et même sur des plateformes CTI tierces, ce qui le rend toujours attrayant parmi les entreprises multi-cloud. Mais cet avantage est rattrapé par les produits concurrents.

L'avantage en termes de coûts de Dialogflow : facturation à trois niveaux et démantèlement des coûts cachés

Le système de tarification de Dialogflow est un modèle combiné de « facturation à la demande + exemption haute fréquence + voix supplémentaire ». Le coût est extrêmement faible dans les scénarios de vérification de prototypes à basse fréquence, mais nécessite une évaluation détaillée dans le cadre d’un déploiement commercial à grande échelle.

Vérification côté C/personnel et prototype

  • Quota gratuit version ES : Les 500 premières requêtes de SMS/jour sont gratuites, avec une limite de débit de 180/minute. Pour les tests de prototypes par une seule personne et la vérification MVP, ce montant peut prendre en charge 2 à 4 semaines de développement et de débogage sans encourir de frais. Après le dépassement, la demande de SMS est de 0,002 $/heure, c'est-à-dire que les frais quotidiens pour le dépassement de 500 fois/jour sont d'environ 1 $ (estimé sur la base de 1 000 fois/jour).
  • Essai gratuit de l'édition CX : crédit d'essai gratuit de 600 $ à dépenser dans les 12 mois. À un prix unitaire médian de CX de 0,015 $ par minute de session, cela peut prendre en charge environ 40 000 minutes (environ 666 heures) de conversations de test, soit suffisamment pour une étape POC de taille moyenne.

Intégration développeur/API

Les modèles de facturation d'ES et de CX sont complètement différents. Les développeurs doivent comprendre les différences sous-jacentes avant de choisir :

Dimensions de facturation Dialogflow ES Dialogflow CX
Unité de facturation Par demande texte/audio Minutes par session d'agent virtuel
Demande de texte prix unitaire 0,002 $/heure Sans objet
Prix ​​unitaire de demande audio 0,0065 $/heure Non applicable (la facturation de la session inclut l'audio)
Prix ​​unitaire des minutes de session N/A 0,007 $ à 0,025 $/minute (selon la région)
Quotas gratuits 500 fois/jour (ES) Crédit d'essai de 600 $
Plafond de taux excédentaire Pas de plafond public Plus l'utilisation est importante, plus le prix unitaire est bas (échelonné)

Sélection des coûts ES vs CX : supposons une moyenne de 10 000 conversations par jour, 5 séries d'interactions textuelles à chaque fois - le forfait ES est d'environ 50 000 fois/jour × 0,002 $ = 3 000 $/mois ; le plan CX est basé sur des séances de 3 minutes × 10 000 fois/jour × 0,015 $ = 13 500 $ – 18 000 $/mois. Le coût unitaire du CX est 4 à 6 fois supérieur à celui de l'ES, mais l'amélioration de l'efficacité du développement de la machine à états Flow lors de la gestion de branches complexes (réduction de 40 à 60 % des retouches) peut compenser la différence de coût dans les opérations à long terme. ES convient aux conversations linéaires telles que les FAQ ; CX convient aux processus complexes tels que le dépôt de réclamations et la modification de commandes en plusieurs étapes.

Déploiement en entreprise/à grande échelle

  • Remise sur engagement d'utilisation (CUD) : bénéficiez de 20 à 40 % de réduction avec un contrat d'engagement de 1 ou 3 ans, et l'édition Enterprise comprend une assistance dédiée et un TOS personnalisé.
  • Coût vocal supplémentaire : STT et TTS sont facturés indépendamment selon les normes Cloud Speech-to-Text. Une session vocale d'une minute coûte environ entre 0,006 et 0,024 USD pour STT et entre 0,004 et 0,016 USD pour TTS, le composant vocal doublant probablement le coût total. Si 50 % des conversations sont vocales, le coût mensuel peut être 1,8 à 2,5 fois supérieur à celui d'un forfait texte uniquement.
  • Frais de sortie de données : pour les backends d'entreprise non hébergés par Google Cloud, les frais de sortie interrégionaux générés par les appels d'API peuvent devenir des coûts cachés. Il est recommandé de déployer le webhook dans la même région Google Cloud pour contourner ce problème.

Conseil sur les coûts cachés : la page de tarification de Dialogflow est claire et détaillée, mais deux coûts sont facilement négligés : premièrement, les environnements de test doivent également être facturés en fonction des appels formels (il n'y a pas de politique « sans bac à sable » ); Deuxièmement, la conservation des instantanés d'environnements pour la gestion des versions entraînera des frais de stockage, et les entreprises qui publient fréquemment des versions doivent y prêter attention.

Principales fonctions de Dialogflow

Le système fonctionnel de Dialogflow peut être divisé en trois couches : le moteur NLU sous-jacent (couche de compréhension), la gestion des dialogues (couche de contrôle) et l'intégration des canaux (couche de distribution). L’effet synergique des trois est supérieur à la somme des capacités individuelles.

  • Reconnaissance d'intention et extraction d'entités : basé sur le modèle dérivé BERT pré-entraîné de Google, il prend en charge les méthodes de correspondance standard et de modèle. Points de synergie cachés : les résultats de l'extraction d'entité peuvent être utilisés à l'envers à des fins de formation : par exemple, l'entité « ville » extraite des entrées de l'utilisateur peut construire dynamiquement des réponses contextuelles, sans qu'il soit nécessaire d'écrire un corpus de formation distinct pour chaque ville. Plus la couverture des synonymes est large, plus l'exactitude de l'intention est élevée, formant une boucle de rétroaction positive de « qualité de l'entité → précision de l'intention ».

  • Flow Visual Orchestration (CX) : CX utilise la machine à états Page pour remplacer l'arborescence de dialogue linéaire. La page contient un état, connecté via la transition, et prend en charge plusieurs stratégies de routage telles que le remplissage des emplacements, les paramètres commerciaux, le déclenchement d'événements, etc. Vue d'expert : la puissance de la machine à états de page réside dans la « réutilisation imbriquée du flux » - la « vérification d'identité » peut être conçue comme un flux indépendant, et le même flux de vérification peut être réutilisé dans 10 flux de dialogue tels que la demande de commande et la déclaration de réclamation. Une fois modifiée, elle prend effet globalement, alors que l'arbre de dialogue traditionnel d'ES nécessite de modifier chaque branche une à une.

  • Repli génératif : lorsque le niveau de confiance de la correspondance d'intention est inférieur au seuil, CX utilise le modèle Gemini pour générer une réponse contextuelle au lieu de renvoyer un "Désolé, je ne comprends pas" rigide. Effet de synergie : le repli déclenche en même temps l'annotation inverse - le système enregistre automatiquement les entrées de l'utilisateur du scénario de repli sous forme d'échantillons « à former », qui sont convertis en un nouveau corpus de formation après examen par lots par les opérateurs, formant un cycle « repli → étiquetage → formation → repli réduit ».

  • Intégration multicanal et expérience cohérente : Dialogflow propose plus de 20 canaux prédéfinis (Google Assistant, Slack, Facebook Messenger, Twilio, Telegram, Zendesk, Salesforce, etc.). Différence clé : tous les canaux partagent la même configuration d'agent : flux de conversation, entités et intention. La logique du Webhook est naturellement cohérente et il n'est pas nécessaire de maintenir des robots indépendants pour chaque canal. « Construire une fois, déployer n'importe où » permet d'économiser un temps d'exploitation et de maintenance important dans les opérations cross-canal.

  • Collaboration agent à agent : CX permet de diviser une grande application conversationnelle en plusieurs sous-agents, chacun s'appelant via des contrats d'entrée/sortie explicites. Écran tombant : un système de service client bancaire peut être composé d'un « agent de requête de compte », d'un « agent de transfert » et d'un « agent de carte de crédit » : l'utilisateur dit « Aidez-moi à vérifier la facture de la carte de crédit » et est automatiquement acheminé vers l'agent de carte de crédit ; "Transférer 500 à Xiao Li" déclenche l'agent de transfert. Chaque agent peut être développé, versionné et déployé indépendamment, réduisant ainsi les conflits de code lorsque de grandes équipes collaborent.

  • Analyse et informations : statistiques du panneau d'analyse intégré, taux de réussite des intentions, taux d'achèvement des sessions, point de désabonnement des utilisateurs et tendances d'analyse des sentiments. Vue d'expert : l'analyse fait passer la conception du dialogue de « l'optimisation des sensations » à une « optimisation basée sur les données » : lorsque le taux de réussite des intentions diminue fortement et que les problèmes de modèle sont éliminés, il est probable que le changement de transition dans le flux en amont entraîne un mauvais acheminement du trafic. Cette relation causale nécessite plusieurs jours d’analyse dans un centre d’appels traditionnel pour être localisée.

Modèle Dialogflow et évolution des versions

L'évolution des versions de Dialogflow peut être divisée en trois étapes : l'étape d'acquisition d'API.ai et de fondation ES, l'étape de réécriture de l'architecture CX et l'étape d'intégration de l'IA générative. Chaque étape correspond à un changement de paradigme technologique dans l’IA conversationnelle.

Phase 1 : versions API.ai Legacy et ES (2016-2019)

  • 2016-09 : Google a acquis API.ai et l'a renommé Dialogflow. API.ai est l'une des plus grandes plates-formes d'IA conversationnelle à l'époque, prenant en charge 15 langues et comptant plus de 100 000 développeurs. Au moment de l'acquisition, la pile technologique de base était un classificateur d'intention basé sur LSTM + un extracteur d'entités CRF.
  • 2017-03 : La version Dialogflow ES (Enterprise) est officiellement publiée, introduisant des fonctionnalités de niveau entreprise : collaboration en équipe, gestion des versions Webhook des fonctions Cloud. La précision de la compréhension du langage naturel atteint plus de 92 % sur les critères de référence communs en anglais (tests internes).
  • 2018-12 : Dialogflow ES prend en charge 20 langues, intègre les actions de Google Assistant sur Google et compte plus d'un million d'utilisateurs finaux actifs par mois. La tarification passe du modèle gratuit au SLA à plusieurs niveaux.

Phase 2 : Réécriture de l'architecture CX (2020-2023)

  • 2020-09 : Google lance Dialogflow CX, une réinvention fondamentale de la couche de gestion des conversations, en remplaçant les arbres de conversation linéaires par un modèle de machine à états. CX n'est pas compatible avec les données de formation d'ES et tous les flux de dialogue doivent être repensés, ce qui constitue le plus gros coût de migration.
  • 2021-05 : CX introduit les appels versionnés de flux, d'environnement et d'agent à agent. Lors de Google Cloud Next '21, un cas de service client télécom contenant 12 sous-agents a été présenté, et les sous-agents ont été communiqués via l'interface REST.
  • 2022-07 : CX publie une mise à jour majeure de la V2.0, améliorant considérablement la console de test - prenant en charge le débogage étape par étape, l'aperçu multi-périphérique du simulateur et la génération automatique de cas de test. L’analyse des sentiments intègre GA.
  • 2023-04 : Une version améliorée de CX Flow est publiée, prenant en charge l'éditeur de conditions visuelles (Condition Builder), abaissant le seuil d'utilisation pour les opérateurs non techniques. Dans le même temps, un « mode hybride » est introduit : une partie du chemin dans le flux de dialogue utilise le moteur de règles et une partie du chemin utilise la correspondance d'intentions ML pour répondre aux besoins des audits de conformité pour une prise de décision déterministe.

La troisième phase : Fusion de l'IA générative (2024 à aujourd'hui)

  • 2024-04 : Dialogflow CX intègre Vertex AI Agent Builder (anciennement Gen App Builder), permettant d'intégrer des nœuds d'IA génératifs dans le flux de dialogue - lorsque la correspondance d'intention n'est pas satisfaite, le modèle Gemini répond directement, réalisant une architecture hybride de « flux de dialogue déterministe + garantie générative ». Parmi eux, la couverture de reconnaissance d’intention de Generative Fallback a augmenté de 22 % lors des tests internes de Google.
  • 2025-06 : Dialogflow CX 2.0 publié. Présentation du générateur génératif d'agent AI : génère automatiquement un brouillon de flux de dialogue via une description en langage naturel (par exemple, la saisie de « créer un processus de retour » générera un flux de dialogue préliminaire comprenant la vérification du SKU et les chemins de remboursement), faisant le saut de « l'orchestration visuelle » à « l'orchestration conversationnelle ».
  • 2026-02 : Dialogflow CX Agent 3.0 publié. Principales améliorations : moteur de streaming d'agent virtuel (prend en charge l'interaction vocale en streaming en temps réel), collaboration agent à agent améliorée (communication de flux bidirectionnelle via gRPC), politique de secours générative améliorée (seuil de confiance de repli configurable et auto-évaluation du modèle en tant que juge). Dans le même temps, il a été annoncé que Dialogflow ES était entré en mode maintenance (mode maintenance), qu'aucune nouvelle fonctionnalité ne serait ajoutée et que seules des mises à jour de sécurité et des corrections de bogues clés seraient effectuées. Essentiellement, il a annoncé que CX serait l’orientation future unifiée.

Jugement du chemin d'intégration de la version : du mode de maintenance ES + réinvestissement continu CX, nous pouvons voir le choix stratégique de Google : à l'avenir, Dialogflow n'aura qu'un seul produit, CX, et les utilisateurs ES seront confrontés à la décision de « migrer ou stagner ». Il est recommandé que les nouveaux projets après 2025 choisissent directement CX ; les utilisateurs qui ont déjà lancé ES organisent une fenêtre de migration de 6 à 12 mois et donnent la priorité à la migration de 20 % des flux de dialogue avec la logique de dialogue la plus complexe pour vérifier le retour sur investissement.

Avantages techniques de Dialogflow

L'avantage technique de Dialogflow ne réside pas dans des indicateurs NLP ponctuels (promesses non vérifiables telles qu'une précision de reconnaissance d'intention de 99,9 %), mais dans sa maturité d'ingénierie full-link - une couverture complète depuis la gestion des données de formation jusqu'au débogage des dialogues, en passant par l'exploitation et la maintenance de la production.

Architecture hiérarchique du moteur NLU : la correspondance d'intention de Dialogflow adopte une architecture en cascade à trois niveaux : le premier niveau de correspondance de règles (intention régulière/modèle) sans délai ; lorsque la règle n'est pas respectée, elle entre dans le deuxième niveau de correspondance ML (modèle BERT distillé), qui génère l'intention + le score de confiance ; lorsque la confiance est inférieure au seuil, il entre dans le troisième niveau de repli génératif (modèle Gemini). La valeur clé est que seule l'optimisation de l'étiquetage de la couche ML n'affectera pas la couche de règles, permettant aux « exigences déterministes » (scénarios de conformité) et aux « exigences généralisées » (Q&A ouvertes) de coexister dans le même agent.

Machine à états de flux vs arbre de dialogue traditionnel : lorsque les branches de l'arbre de dialogue traditionnel sont imbriquées à plus de 3 niveaux, le coût de maintenance augmente de façon exponentielle ; La machine à états Page de CX traite le dialogue comme une structure graphique de « entrée utilisateur → transition d'état ». Pour un processus métier bancaire avec 5 conditions de branche, l'arbre de dialogue nécessite une énumération manuelle de 120 chemins, mais la machine d'état n'a besoin que de définir 5 pages et 5 ensembles de conditions de transition, et le taux de couverture des chemins imprévus augmente d'environ 60 % à 95 %+. Il s'agit de la base d'ingénierie qui permet à CX de réaliser « plus de 500 intentions de gestion d'agent unique », mais c'est difficile à réaliser pour ES.

Effet de coût marginal décroissant des données de formation : Dialogflow fournit plus de 60 types d'entités système prédéfinies, de sorte que les entreprises n'ont pas besoin d'annoter le corpus de formation pour les entités générales. Une fois en ligne, les données de conversation réelles peuvent être exportées par lots sous forme de phrases de formation « en attente de révision » : les opérateurs peuvent les accepter ou les rejeter en un seul clic sur la console, et les échantillons acceptés sont automatiquement ajoutés à l'ensemble de formation. Cela signifie que les données de formation de l'agent en ligne augmenteront d'elles-mêmes pendant le fonctionnement continu et que le retour sur investissement de chaque cycle d'annotation manuelle augmentera en raison de l'expansion de la couverture des synonymes. Condition préalable : les entreprises doivent maintenir un engagement minimum de 1 à 2 heures par semaine pour l'annotation.

Bonus sous-jacent à l'infrastructure Google Cloud : le Webhook de Dialogflow peut être étendu de manière transparente dans GKE ; les journaux sont connectés à BigQuery via Cloud Logging pour une analyse approfondie ; les données de conversation peuvent être directement associées aux balises client pour des réponses personnalisées. Pour les entreprises qui utilisent déjà Google Cloud, sa profondeur d'intégration apporte une simplification opérationnelle difficile à reproduire avec AWS Lex ou Azure Bot Service : aucune configuration IAM multi-cloud ni pipeline de journaux supplémentaire n'est requis. Mais pour les clients non-Google Cloud, cet avantage est réduit à neutre.

Comment utiliser Dialogflow

Le chemin d'utilisation de Dialogflow va de la simple démo Web à l'intégration d'API profondément personnalisée, couvrant les besoins de différents rôles. Ce qui suit est expliqué dans l’ordre progressif « de zéro à la production ».

Démarrage rapide : Déployez un agent de démonstration (CX) en 3 minutes

Les services gcloud activent dialogflow.googleapis.com

curl -X POST -H "Autorisation : porteur $ (gcloud auth application-default print-access-token)" \
  -H "Type de contenu : application/json" \
  -d '{"displayName": "MyFirstAgent", "description": "Démo de démarrage rapide", "timeZone": "Asie/Shanghai", "langueCode": "zh-CN"}' \
  "https://dialogflow.googleapis.com/v3/projects/<PROJECT_ID>/locations/global/agents"

Remarque : <PROJECT_ID> doit être remplacé par l'ID réel du projet. Pour connaître les étapes complètes, veuillez vous référer à la documentation officielle de Google Cloud.

Comparaison des modes d'entrée

Comment utiliser Convient à la foule Capacités clés Coût
Interface utilisateur Web de Cloud Console Concepteurs, opérateurs de dialogue Orchestration des flux visuels, console de tests, gestion des données de formation, panel d'analyse Uniquement la comptabilité des appels d'agent
API/SDK Dialogflow Développeurs, intégrateurs de systèmes Interface REST/gRPC, SDK multilingue (Node.js/Python/Java/C#/Go/PHP) Facturation des appels API
Plateforme CCAI (Contact Center AI) Grand centre de contact IA intégrée de Google Cloud Contact Center, Agent Assist, transcription vocale en temps réel Facturation par siège d'agent + volume d'appels
Créateur d'agent Vertex AI Développeur d'applications IA Construire un agent en langage naturel basé sur l'IA générative, génération automatique de flux de conversation Facturé par l'appel API Gemini

Points de conception de l'agent : L'unité de conception recommandée pour l'agent CX est « Flux » plutôt que « Intention ». Une bonne pratique consiste à répartir les flux par sous-domaines métiers : chaque flux correspond à un parcours utilisateur complet (par exemple, le flux « demande de retour » contient trois pages : vérification du SKU, sélection du mode de remboursement et génération des commandes logistiques). La taille appropriée pour le nombre de pages dans un flux est de 5 à 10. S'il dépasse le nombre, cela signifie que le flux doit être divisé. Les flux exposent des contrats clairs de paramètres d’entrée et de paramètres de sortie pour former des modules de capacité de dialogue réutilisables.

Guide des pièges d'ingénierie (basé sur la communauté et les pratiques de production)

  1. Boucle morte et augmentation de jetons : lorsque CX Flow n'est pas conçu correctement, l'agent peut appeler à plusieurs reprises Webhook dans la boucle de confirmation → clarification, et une seule demande d'utilisateur générera des dizaines d'appels d'API. Solution : définissez max_escalation_steps pour limiter le nombre d'étapes de mise à niveau, configurez la transition d'expiration pour chaque page (retour automatique à la page racine ou passage en manuel s'il n'y a pas de réponse dans 30 secondes) et définissez le Webhook sur un délai d'expiration de 2 à 3 secondes et jusqu'à 3 tentatives.

  2. Surcharge de données de formation et confusion des intentions : lorsqu'il y a plus de 200 intentions d'agent et que la similarité du corpus de formation est élevée, l'écart de confiance des 2 intentions principales se réduit. Solution : effectuez une analyse de la matrice de confusion chaque mois, répertoriez les 2 principales paires d'intentions avec une différence de confiance < 0,1 comme « besoin de fusionner ou d'ajouter un corpus différencié » et utilisez l'outil d'évaluation NLU de CX pour étiqueter automatiquement les paires de confusion à haut risque.

  3. Délai et délai d'expiration de la couche de canal : le délai du canal externe (200 à 800 ms) est superposé au délai d'inférence Dialogflow (100 à 400 ms) et au délai du Webhook (500 à 3 000 ms), qui peut dépasser 5 secondes de bout en bout. Solution : définissez un délai d'expiration hiérarchique multicanal - exigez que le Webhook revienne dans les 2 secondes pour les SMS/IM et qu'il soit rétabli en cas d'expiration du délai ; détendez-vous à 5 secondes pour les canaux à haute tolérance de retard tels que l'Assistant. Activez Cloud Tasks pour traiter les opérations clés de manière asynchrone côté webhook.

  4. Sécurité et contrôle non autorisé : Webhook reçoit par défaut les requêtes via le point de terminaison HTTP(S) du réseau public, et les requêtes non authentifiées peuvent être injectées avec des charges utiles malveillantes. Solution : activez la vérification de la signature des demandes Webhook (JWT ou HMAC), attribuez les autorisations IAM selon le principe du « minimum nécessaire » et définissez une confirmation secondaire côté Webhook pour les pages contenant des opérations irréversibles.

Prix des produits pour Dialogflow

La structure tarifaire de Dialogflow est d'un niveau de complexité moyen dans la gamme de produits Google Cloud : la dimension de facturation couvre deux modèles : "volume de demande" (ES) et "durée de session" (CX), et la partie vocale est facturée par un service Cloud AI indépendant. Les éléments suivants sont divisés en trois couches : côté C/individuel, développeur/API, entreprise/à grande échelle.

Vérification côté C/personnel et prototype

Projet Version ES Version CX
Quotas gratuits 500 fois/jour (demandes de SMS) Crédit d'essai de 600 $ (valable 12 mois)
Limite de taux 180 fois/minute 600 fois/minute (période d'essai)
Tarifs dépassés 0,002 $/heure (texte), 0,0065 $/heure (audio) 0,007 $ à 0,025 $/minute de session
Nombre d'agents d'essai Illimité Jusqu'à 10

Déduction : Prototype minimaliste avec une moyenne de 100 conversations par jour (5 tours d'interactions chacun = 500 requêtes/jour), la version ES ne dépasse tout simplement pas le quota gratuit. Les frais d'essai de 600 $ pour la version CX peuvent prendre en charge environ 40 000 minutes de session (à 0,015 $/minute), ce qui est suffisant pour un cycle POC de 3 à 6 mois. Si vous n'effectuez pas la mise à niveau et ne payez pas une fois le POC terminé, l'agent sera suspendu - faites attention à la fenêtre de temps d'exportation des données de formation.

Intégration développeur/API

ES est facturé en fonction du volume de requêtes (un dialogue linéaire basse fréquence est recommandé) :

Type de demande Prix ​​unitaire
Demande de texte 0,002 $/heure
Requête audio (y compris le prétraitement STT) 0,0065 $/heure
Requête de la base de connaissances 0,002 $/heure (texte) + frais de stockage d'index Ko

En prenant comme exemple une entreprise de service client de taille moyenne qui gère 5 000 interactions textuelles par jour, les frais mensuels sont de ≈ 5 000 × 30 × 0,002 $ = 300 $/mois. Des frais STT sont également demandés (si entrée audio et vidéo).

CX est facturé selon la durée de la session (recommandé pour les tours multiples complexes et convivial) :

Région Prix ​​à la minute de la session (Texte+Voix Mixte)
Amérique du Nord 0,015 $/minute
Europe 0,018 $/minute
Asie-Pacifique 0,010 $ à 0,015 $/minute
Amérique du Sud 0,012 $/minute

En prenant comme exemple une moyenne de 2 000 conversations par jour et une durée moyenne de conversation de 3 minutes, les frais mensuels ≈ 2 000 × 3 × 30 × 0,015 $ = 2 700 $/mois. CX est plus rentable pour les applications à forte intensité vocale, car plusieurs séries d'interactions vocales au cours d'une même session ne sont pas facturées de manière répétée (alors que ES est facturé séparément pour chaque série de demandes audio).

Déploiement en entreprise/à grande échelle

  • Remise sur engagement d'utilisation (CUD) : environ 20 % de remise pour un engagement d'un an, environ 40 % de remise pour un engagement de 3 ans, s'applique aux minutes de session CX et au volume de demandes ES.
  • Frais supplémentaires de la plateforme CCAI : Si vous avez besoin d'Agent Assist (assistance d'agent en temps réel), de transcription vocale en temps réel et d'analyse des sentiments, vous devez acheter une licence supplémentaire de la plateforme CCAI, qui est facturée en fonction des sièges d'agent (50 $ à 150 $/siège par mois) + volume d'appels.
  • Impact sur la qualité du service vocal : l'utilisation d'un STT de haute précision (tel que le modèle optimisé pour le téléphone « phone_call ») est 3 à 5 fois plus coûteuse que le modèle standard. Si le scénario principal est l'IVR téléphonique, les frais vocaux peuvent dépasser 60 % du Dialogflow lui-même. Des réductions sur les services vocaux peuvent être négociées dans le cadre de contrats d'entreprise.

Remarque : les prix ci-dessus sont basés sur la page de tarification publique de Google Cloud. Le prix réel du contrat varie en fonction de l'utilisation et de la politique de remise.

Scénarios d'application Dialogflow

Les scénarios applicables de Dialogflow couvrent les deux extrémités du spectre de « l'interaction standardisée à haute fréquence » et du « dialogue de processus complexe ». Son principal avantage est qu'il utilise un moteur de conversation unifié pour couvrir les canaux texte et vocaux, et qu'il peut être profondément intégré à l'écosystème de données Google Cloud (BigQuery, Cloud Storage, Pub/Sub).

  • Robot de service client de marque (commerce de détail/finance/tourisme) : il s'agit de la direction d'application la plus mature de Dialogflow. Les tâches typiques incluent les demandes de renseignements sur l'état des commandes, les demandes de retour et d'échange, le pré-traitement des changements de vol/d'hôtel, l'interprétation des factures de carte de crédit et d'autres questions et réponses à haute fréquence. Réduction des coûts et amélioration de l'efficacité : pour une équipe de service client de marque avec une moyenne de 3 000 interactions par jour, après l'introduction de Dialogflow CX, environ 70 % des requêtes répétitives peuvent être traitées automatiquement, et les agents manuels se concentrent sur les réclamations complexes et les scénarios de vente à valeur ajoutée. Sur la base d'une équipe de service client de taille moyenne (15 personnes, salaire mensuel moyen par personne : 8 000 yuans), l'effet de remplacement d'environ 3 à 4 agents à temps plein peut être obtenu, avec des économies annuelles d'environ 300 000 à 400 000 yuans. Limite de collaboration homme-machine : lorsque le montant du remboursement dépasse le seuil (par exemple plus de 500 yuans), que le score négatif de l'analyse du sentiment du client est > 0,7, ou que l'utilisateur demande à être transféré vers un agent humain deux fois de suite, l'agent humain doit être automatiquement transféré et l'IA ne prendra pas la décision finale.

  • Smart Voice IVR (Télécom/Banque/Affaires gouvernementales) : Remplace le menu téléphonique DTMF traditionnel « appuyez sur 1 pour vérifier le solde, appuyez sur 2 pour vérifier le solde ». Les utilisateurs peuvent directement dire « Aidez-moi à vérifier la facture de téléphone du mois dernier » ou « Je souhaite prendre rendez-vous pour demander un passeport ». Le système sera automatiquement acheminé vers le système commercial correspondant après avoir compris l'intention via NLU. Conseil : Le contexte sonore (véhicule, lieux publics) et les changements d'accent dans les scénarios d'IVR vocal affecteront considérablement la précision du STT. Il est recommandé de donner aux utilisateurs des instructions claires pour « prononcer des phrases courtes » dans l'invite initiale du SVI (par exemple, « Veuillez me dire de quel service vous avez besoin en un ou deux mots ») afin de contrôler le taux d'erreur STT en dessous de 15 %. Lorsque plus de 90 % des services haute fréquence atteignent la cible via la voix en même temps, cela est défini comme un « succès de l'automatisation IVR ».

  • Assistant interne des employés (RH/IT/Juridique) : Connectez la base de connaissances de l'entreprise et le système SaaS (Workday, ServiceNow, Confluence) pour gérer des opérations telles que la vérification des fiches de salaire des employés, la demande de congé, la soumission des bons de travail informatiques et la recherche des termes du contrat. Points clés d'acceptation : Le taux de précision se concentre sur la "Résolution au premier contact (FCR)" - la proportion d'utilisateurs qui peuvent répondre à leurs exigences sans passer au travail manuel. Il est recommandé d’utiliser 70 % comme objectif de base. Une valeur inférieure à cela indique que la couverture de la base de connaissances ou la précision NLU doit être optimisée.

  • Questions et réponses sur la conformité multicanal (finance/médecine/assurance) : fournissez des réponses cohérentes en matière d'informations sur la conformité sur plusieurs canaux (application Web, WeChat WhatsApp) - telles que des explications sur les conditions d'assurance, des demandes de renseignements sur les effets secondaires des médicaments et des questions et réponses réglementaires. Exigences implicites pour la mise en œuvre : les scénarios de conformité ont des exigences extrêmement élevées en matière de sortie de texte original. Il est recommandé d'utiliser du texte fixe au lieu de réponses génératives dans la réponse d'intention de Dialogflow (même le repli génératif doit être désactivé ou limité à la bibliothèque de contenu audité). Configurez un environnement de version indépendant pour chaque intention de conformité, et chaque modification de contenu doit passer par un processus d'approbation avant d'être publiée dans l'environnement de production.

Ne convient pas aux scénarios : Dialogflow ne convient pas aux scénarios de dialogue qui nécessitent "un domaine complètement ouvert, sans état et hautement créatif" - ​​comme un chat de jeu de rôle, un compagnonnage d'écriture créative et des conseils pour la rédaction d'articles académiques. Dans ces scénarios, la flexibilité et la qualité de production des solutions LLM pures (telles que OpenAI GPT, Claude) dépassent de loin le cadre de dialogue restreint de Dialogflow. Il ne convient pas non plus aux scénarios conversationnels nécessitant un fonctionnement hors ligne ou une informatique de pointe. Dialogflow est un service entièrement géré et ne prend pas en charge le déploiement sur site, et la connectivité aux API Google Cloud doit être maintenue même au sein du réseau privé du CX.

Dialogflow convient aux personnes

Le groupe d'utilisateurs cible de Dialogflow est constitué des « organisations et équipes qui ont besoin de créer des expériences de conversation déterministes ». Il ne convient pas aux passionnés de développement d’IA qui recherchent une flexibilité maximale, ni aux utilisateurs professionnels purs n’ayant aucune exigence de codage.

  • Conversation Designer et UX Copywriter : concevez le chemin de dialogue via l'éditeur visuel Flow de CX et configurez le texte de réponse correspondant à l'intention. Résultats : Organigramme de dialogue, corpus de formation Configuration système/entité Stratégie de repli. Prérequis : Avoir une certaine base en pensée logique et en conception d'expérience utilisateur, aucune expérience en programmation n'est requise. Ne convient pas aux limites : lorsque le flux de conversation dépasse 50 pages, l'efficacité de l'édition par glisser-déposer pur style Figma diminue considérablement et des outils de gestion par lots API/CLI doivent être utilisés.

  • Développeur Backend/Full Stack : mettre en œuvre l'amarrage de la logique métier via l'API Dialogflow et Webhook, y compris l'intégration du système de commande CRM et de la base de connaissances. Tâches typiques : implémenter le traitement des points de terminaison Webhook, remplir les emplacements, appeler une API tierce pour renvoyer des données dynamiques et gérer la version de l'environnement. Ne convient pas aux limites : la profondeur d'intégration des environnements non Google Cloud (tels qu'AWS et Alibaba Cloud) est limitée. La latence des webhooks dépend de la qualité de la communication sur le réseau public. Il est recommandé de déployer des Webhooks dans la même région de Google Cloud pour obtenir une latence ≤10 ms.

  • Ingénieur IA/ML : concentrez-vous sur la gestion de la qualité des données de formation, l'optimisation de la précision NLU et l'analyse de la confusion des intentions. Tâches typiques : exécutez l'évaluation de l'agent pour générer une matrice de confusion, analysez le mode de repli dans le journal et optimisez la diversité du corpus de formation. Ne correspond pas aux limites : Dialogflow ne fournit pas d'interface de réglage fin pour les modèles personnalisés : vous ne pouvez pas déployer vos propres pondérations de réglage fin BERT ou LLM sur le moteur NLU de Dialogflow. Sa couche ML est une boîte noire gérée par Google. Si votre entreprise nécessite des modèles NLU hautement personnalisés (tels que l'extraction d'entités médicales), il est recommandé de choisir Google Vertex AI ou une plateforme NLU externe.

  • Chef de produit et opérations commerciales : Définir des stratégies de dialogue, configurer la base de connaissances, surveiller les panels d'analyse et optimiser la couverture des intentions. Sorties : liste de couverture des intentions, rapport d'analyse de secours. Prérequis : Familier avec la structure de la base de connaissances métier et capable d'identifier les demandes des utilisateurs que l'Agent actuel ne peut pas traiter.

  • Architectes d'entreprise et décideurs en matière d'approvisionnement : évaluez le positionnement de Dialogflow dans la pile technologique, comparez-le avec les produits concurrents (Lex, Azure Bot Service, Nuance) et promouvez les POC et les négociations commerciales. Conditions préalables d'achat : l'entreprise dispose déjà ou prévoit d'adopter l'infrastructure Google Cloud ; il existe des scénarios clairs de service client/dialogue au lieu de « utiliser d’abord l’IA, puis trouver des scénarios ». Ne convient pas aux frontières : pour les secteurs où les exigences de souveraineté des données doivent être déployées localement (comme certaines agences gouvernementales et institutions financières), le modèle entièrement géré de Dialogflow ne répond pas aux exigences de conformité, et la solution Sovereign Cloud de Google Cloud ou les produits concurrents localisés doivent être pris en compte.

Résumé et Outlook

Dialogflow a établi une solide barrière technique dans le domaine de « l'orchestration déterministe du dialogue » : le modèle de machine à états Page de CX a une efficacité de maintenance nettement supérieure à celle de la solution d'arbre de dialogue linéaire lorsqu'il est confronté à des scénarios de dialogue multicanal à haute fréquence et de grande complexité, et l'introduction d'un repli génératif compense les lacunes du NLU traditionnel dans des domaines ouverts hautement généralisés. Il ne s’agit pas d’un produit de laboratoire d’IA disruptif, mais d’une plateforme d’ingénierie conversationnelle pour un contexte de production.

Principaux avantages actuels : L'architecture de machine à états Flow de CX est la solution d'orchestration déterministe la plus mature parmi les plates-formes d'IA conversationnelles grand public actuelles ; l'intégration sans friction avec l'écosystème de données Google Cloud (BigQuery, Cloud Logging, Vertex AI) constitue un obstacle important à la migration ; La couverture NLU de plus de 30 langues et la capacité de « construire une fois, déployer partout » sur plusieurs canaux sont des valeurs rares dans les scénarios d'entreprise mondiale.

Principales limitations actuelles : La version ES est entrée en mode maintenance et toutes les ressources sont orientées vers CX, mais la courbe d'apprentissage de CX est beaucoup plus élevée que celle d'ES - il faut généralement 2 à 4 semaines entre l'apprentissage du concept et l'achèvement du premier agent de niveau production ; Dialogflow n'offre pas la capacité de réglage fin des modèles NLU personnalisés et s'appuie sur le rythme de mise à jour des modèles pré-entraînés de Google (généralement 3 à 6 modèles de langage mis à jour une fois par mois), et peut ne pas être en mesure de répondre à la demande de scénarios qui nécessitent une réponse rapide aux changements de corpus (tels que le nouveau vocabulaire de produits émergeant lors des promotions de commerce électronique) ; Les clauses de souveraineté des données de Google Cloud sont encore controversées dans certains pays/régions, et leur attrait pour les secteurs financier et gouvernemental est limité ; par rapport à la solution LLM d'Anthropic ou d'OpenAI, Dialogflow fonctionne mal dans les conversations créatives en domaine ouvert et n'est pas adapté aux scénarios de conversation totalement flexibles.

Points d'observation de suivi : le calendrier officiel hors ligne d'ES (durée du mode maintenance) et le degré de perfection de la chaîne d'outils de migration ; la latence et les performances en termes de coûts de l'expérience vocale en streaming de CX Agent 3.0 dans le cadre d'un déploiement réel ; si Google ouvrira l'interface de réglage fin de la couche NLU de CX pour répondre aux défis de flexibilité des produits concurrents ; le chemin d'intégration de Vertex AI Agent Builder et Dialogflow CX - les deux ont actuellement des fonctions qui se chevauchent, et s'ils seront fusionnés en un produit unifié à long terme.

Évaluation des risques d'approvisionnement et d'adoption : pour les entreprises déjà présentes dans l'écosystème Google Cloud, Dialogflow CX est le choix par défaut pour les plates-formes d'IA conversationnelle. Il est recommandé de lancer un POC à partir de scénarios commerciaux non critiques (tels qu'un service d'assistance informatique interne, des robots FAQ) pour vérifier si l'équipe peut maîtriser le paradigme de conception de CX dans un délai de 2 à 4 semaines. Pour les entreprises non Google Cloud, il est recommandé d'évaluer si la latence du réseau et les frais de sortie pour l'intégration multi-cloud sont acceptables avant le POC. Dialogflow CX n'est pas adapté au "lancement rapide d'un simple robot de questions et réponses" - dans ce scénario, il est plus rentable d'utiliser ES ou une solution pure LLM (API + Prompt). Lors de la signature d'un contrat d'entreprise, il est important de confirmer : l'élasticité de la remise d'utilisation promise (si un remboursement sera effectué lorsque l'utilisation est inférieure à l'engagement), si le SLA du service vocal est cohérent avec le service texte et si une copie de sauvegarde est conservée côté Google Cloud après la suppression des données. La qualité de sortie au niveau de la production de Dialogflow CX dépend fortement d'un investissement opérationnel continu (au moins 2 à 4 heures d'annotation de données et d'optimisation d'intention par semaine). Les entreprises qui manquent de ressources d'annotation peuvent être confrontées à une dégradation de la précision NLU après 3 à 6 mois. Avant d'acheter, vous devez évaluer si l'entreprise est prête à supporter ces coûts cachés de main-d'œuvre opérationnelle.

Outils associés : Recherche profonde, ChatGPT

Informations de version

  • Agent Dialogflow CX 3.0 :Améliorez le moteur de flux d'agent virtuel, améliorez les capacités de collaboration agent à agent et mettez à niveau la stratégie de secours générative.
  • Flux de dialogue CX 2.0 :Présentation d'un générateur d'agents génératif basé sur l'IA qui prend en charge les descriptions en langage naturel pour créer automatiquement des flux de conversation.

Avis des utilisateurs

  • Chargement des avis...