FluxDiscours Gratuit

-

L'outil de synthèse vocale IA prend en charge la synthèse vocale, le clonage vocal, le doublage multilingue et le contrôle fin SSML, et est orienté vers la création de contenu, les livres audio, le doublage vidéo et les scénarios de service client.

FluxDiscours Interface du produit

Flowdiscours

Flowspeech est une plateforme de synthèse et de traitement vocal basée sur l'IA qui se concentre sur la conversion de texte en sortie vocale naturelle et fluide. Il couvre les capacités de liaison complète depuis la TTS de base jusqu'au clonage vocal avancé, au doublage multilingue et au contrôle précis de SSML (Speech Synthesis Markup Language), et convient à des scénarios tels que l'enregistrement de livres audio, le doublage vidéo et le service client vocal.

Sur le marché chinois du TTS, le positionnement concurrentiel principal de Flowspeech est « convivial pour les créateurs » : il ne poursuit pas un nombre exhaustif de fonctions, mais se concentre sur la qualité sonore, la facilité d'utilisation et le naturel chinois. Cette stratégie crée une concurrence différenciée avec les services TTS « basés sur l'infrastructure » de fournisseurs de cloud tels qu'Alibaba Cloud et Tencent Cloud.

Paramètres et statistiques de base

Élément de paramètre Valeur
Nombre de sons prédéfinis 50+ (y compris les voix masculines et féminines chinoises et anglaises, les voix d'enfants, les dialectes et les sons de caractères spéciaux)
Langues prises en charge Chinois, anglais, japonais, coréen, français, allemand, espagnol, arabe
Clonage vocal Pris en charge (télécharger 30 secondes d'audio de référence à cloner)
Nombre maximum de sons clonés enregistrés 5 (Gratuit) / 30 (Pro) / 100 (Entreprise)
Limite de caractères TTS unique 5 000 caractères (gratuit) / 20 000 caractères (Pro)
Format audio de sortie MP3/WAV/FLAC/OGG
Taux d'échantillonnage 16 kHz / 24 kHz / 48 kHz en option
Prise en charge SSL Prise en charge complète (taux, pitch, pauses, stress, balises d'émotion)
Composition en direct API WebSocket, latence de bout en bout ~0,8 secondes
Post-traitement audio Recadrage, normalisation du volume, suppression du bruit

Interprétation des paramètres : plus de 50 sons prédéfinis couvrent un large éventail de styles, des émissions d'information aux personnages bidimensionnels. Le seuil sonore pour le clonage avec 30 secondes d'audio de référence est nettement inférieur à l'exigence moyenne de l'industrie de 1 à 3 minutes. La prise en charge de SSML permet aux développeurs de contrôler avec précision le rythme et l'expression émotionnelle de la parole synthétisée. La sortie à taux d'échantillonnage élevé de 24 kHz/48 kHz peut répondre aux exigences de qualité sonore de la diffusion et du doublage professionnel.

Reconnaissance des utilisateurs et du marché

Sensibilisez progressivement les utilisateurs sur le terrain et les capacités du produit sont utilisées par les créateurs de contenu et les équipes pour améliorer l'efficacité du travail. Certains utilisateurs de l'industrie l'ont intégré à leur flux de travail quotidien. Il est recommandé de se référer aux dernières divulgations officielles pour connaître les données spécifiques sur l’échelle des utilisateurs et le taux d’adoption par l’industrie.

Avantage de coût

Dimensions de comparaison Flowspeech (Pro) Alibaba Cloud TTS OnzeLabs
Seuil de frais mensuels 59 ¥/mois Facturation au fur et à mesure (≈¥100/million de caractères) 5$/mois (entrée)
Nombre de sons prédéfinis 50+ 100+ 100+
Clonage vocal Pris en charge (la version Pro comprend 30 emplacements de clonage) Personnalisation requise Pris en charge (à partir de 22 $/mois)
Le naturel chinois Excellent (formation en localisation chinoise) Excellent Bon (l'anglais est préférable)
Prise en charge SSL Complet Complet Limité
Quotas gratuits 10 000 caractères par mois 2 millions de caractères par mois (nouveaux utilisateurs) 10 000 caractères par mois

Flowspeech présente des avantages rentables évidents dans le scénario TTS chinois : par rapport au modèle de facturation par répartition d'Alibaba Cloud, les frais mensuels fixes sont plus adaptés aux équipes de création de contenu ayant une consommation de caractères stable ; par rapport à ElevenLabs, Flowspeech est plus avantageux en termes de naturel de la parole chinoise et de prise en charge du dialecte.

Coûts cachés : le quota de 500 000 caractères/mois de la version Pro pourrait ne pas suffire à l'équipe de production de livres audio haute fréquence (le volume quotidien moyen est supérieur à 30 000 mots), et l'excédent sera facturé à 0,5 ¥/10 000 caractères ; la restauration du son cloné sera considérablement réduite sur l'audio de référence avec fond bruité.

Fonctions principales

  • Text to Speech (TTS) : saisissez du texte pour générer une parole naturelle, prenant en charge l'ajustement de la vitesse de parole (0,5x-2,0x), de la hauteur, du volume et du ton émotionnel (calme/joyeux/sérieux/surpris, etc.). La latence de synthèse de texte de 300 caractères est d'environ 0,8 seconde.
  • Voice Clone : téléchargez un audio de référence de plus de 30 secondes, extrayez automatiquement les fonctionnalités d'empreinte vocale et générez une tonalité clonée, qui peut être enregistrée dans une bibliothèque de tonalités personnelle. Les sons du clone ont atteint un MOS de 3,8/5 au test de similarité.
  • Éditeur SSML : un panneau d'édition visuel de balises SSML qui prend en charge un contrôle précis des détails tels que les pauses, les accents, la prononciation des nombres et l'expansion des abréviations dans la parole synthétisée.
  • Doublage multilingue : Le même texte peut être basculé entre les langues en un seul clic pour générer un doublage, et le son original peut être transféré vers d'autres langues.
  • Synthèse par lots et traitement de textes longs : téléchargez des fichiers texte (CSV/TXT) par lots, segmentez automatiquement les textes longs et synthétisez-les séquentiellement, et les résultats de la synthèse sont empaquetés et téléchargés.
  • Synthèse de streaming en temps réel : interface API WebSocket, le premier délai de tonalité est contrôlé dans les 500 ms, adapté aux assistants vocaux en temps réel et aux scénarios de doublage en direct.
  • Outils de post-production audio : outils intégrés de recadrage, de normalisation du volume et de suppression du bruit.

Evolution du modèle et de la version

Version Date de sortie Changements majeurs
v0.9 (bêta interne) 2026-06-05 Synthèse TTS de base, 20 sons prédéfinis, ne prend pas en charge le clonage vocal et SSML
v1.0 (bêta publique) 2026-07-14 Plus de 50 bibliothèques de sons, clonage vocal, éditeur SSML, synthèse multilingue, API de streaming

Les principales mises à niveau de la version bêta publique par rapport à la version bêta interne : clonage vocal et contrôle fin SSML - ces deux fonctionnalités font passer Flowspeech de "peut faire du TTS" à "peut remplacer le doublage professionnel". La version 1.1 prévue ajoutera la synthèse vocale émotionnelle et la synthèse de dialogues à plusieurs personnes.

Avantages techniques

  • Architecture de synthèse vocale hybride : combine le modèle acoustique Tacotron classe 2 avec un vocodeur de classe HiFi-GAN pour équilibrer la vitesse d'inférence et la qualité sonore. Par rapport au modèle pur de bout en bout, l’architecture hybride offre une meilleure cohérence lors de la synthèse de textes longs et est moins sujette aux dérives de timbre ou aux sauts de mots.
  • Extraction d'empreinte vocale sur quelques échantillons : Basé sur l'architecture Speaker Encoder, il ne faut que 30 secondes d'audio de référence pour extraire un vecteur d'intégration d'empreinte vocale stable. Similitude du timbre clone MOS 3,8/5 – inférieure à l'enregistrement en personne réelle (MOS 4,5+) mais à un niveau élevé dans le domaine de la synthèse de l'IA.
  • Optimisation de la prosodie chinoise : Un modèle prosodique spécialement formé pour le corpus chinois, qui fonctionne mieux que le modèle multilingue général en termes de pauses, de murmures, d'idiomes et d'inflexions. Il s’agit d’un obstacle concurrentiel majeur par rapport aux produits anglophones comme ElevenLabs.
  • Rendu SSML en temps réel : les balises SSML agissent directement sur les paramètres du modèle acoustique plutôt que sur le traitement post-signal, garantissant une haute précision et de faibles artefacts dans le contrôle des balises.
  • Pipeline de synthèse en streaming : grâce à une conception de pipeline asynchrone, l'analyse de texte et la génération acoustique peuvent être exécutées en parallèle, et le délai de la première note est contrôlé dans les 500 ms.

Comment utiliser

Comment utiliser Entrée Instructions
Éditeur TTS Web Site officiel → Synthèse en ligne Saisissez du texte, sélectionnez le timbre, ajustez les paramètres, écoutez en ligne et téléchargez
Panneau d'édition SSML Mode avancé Modifiez visuellement les balises SSML et prévisualisez l'effet en temps réel
Page de clonage vocal Gestion du son → Cloner le son Téléchargez l'audio de référence, nommez et enregistrez
API REST Documentation développeur Requête HTTP pour appeler TTS et cloner l'interface
API WebSocket Documentation développeur Synthèse en streaming, adaptée aux applications vocales en temps réel

Processus d'utilisation typique : sélectionner le mode de synthèse → saisir ou télécharger du texte → sélectionner le timbre et les paramètres → réglages d'audition → exporter des fichiers audio.

Prix des produits

Forfait Prix ​​ Avantages de base
Version gratuite 0 ¥/mois 10 000 caractères par mois, 20 sons de base, sortie au format MP3, y compris le filigrane de la plateforme
Version professionnelle 59 ¥/mois (paiement annuel 49 ¥) 500 000 caractères par mois, plus de 50 sons, clonage vocal (30 emplacements), SSML, pas de filigrane
Édition Entreprise 299 ¥/mois 5 millions de caractères par mois, clonage vocal (100 slots), API de synthèse streaming, SSO, mise au point exclusive du modèle

Les caractères supplémentaires seront facturés 0,5 ¥/10 000 caractères. Les nouveaux utilisateurs recevront un essai de 14 jours de la version Pro lors de leur inscription.

Scénarios d'application

  • Livre audio et enregistrement audio long : téléchargez la transcription du livre pour synthétiser le discours par chapitre, sélectionnez le ton de caractère approprié et exportez par lots. La méthode traditionnelle nécessite que les doubleurs enregistrent pendant plusieurs jours, mais Flowspeech peut compresser le cycle de production à quelques heures. Méthode de vérification : extrayez 3 à 5 minutes de clips synthétiques et effectuez une comparaison de tests à l'aveugle avec des enregistrements réels.
  • Doublage vidéo et localisation multilingue : les créateurs de vidéos écrivent des scripts chinois et les convertissent en doublages anglais, japonais, coréens et dans d'autres langues en un seul clic. Convient aux équipes de contenu étrangères qui souhaitent publier simultanément sur plusieurs marchés linguistiques. Méthode de vérification : données sur le taux de complétion des utilisateurs de la version multilingue sur le marché cible.
  • Enseignement en ligne et doublage de cours : les établissements d'enseignement génèrent par lots le doublage des conférenciers, unifient le timbre et le style, et SSML contrôle la vitesse de parole et les pauses du contenu clé. Méthode de vérification : Les étudiants écoutent les commentaires du test.
  • Menu vocal intelligent IVR : le service client de l'entreprise utilise TTS pour générer des voix de menu IVR multilingues et les combine avec des API de streaming pour réaliser une diffusion de contenu dynamique. Méthode de vérification : taux d’achèvement des clients et taux d’appels répétés du menu IVR.

Personnes concernées

Foule Valeur d'adaptation Descriptif
Créateur de contenu/propriétaire UP Réduisez les coûts de doublage et produisez rapidement des versions multilingues Version gratuite ou version Pro
Équipe de production de livres audio L'efficacité de la synthèse par lots dépasse de loin l'enregistrement traditionnel Version Pro ou Entreprise recommandée
Entreprise de technologie éducative Cohérence du doublage des cours et itération rapide Nécessite l'intégration SSML et API, version entreprise
Service client entreprise Génération automatique de voix IVR et notification Nécessite une API de streaming et une prise en charge de haute concurrence
Créateur de podcasts Générez rapidement des intros, des outros et des slogans Version gratuite

Ne convient pas aux personnes : doublage de personnages qui nécessitent une tension émotionnelle extrêmement élevée (comme un dialogue au niveau d'un film, un jeu de rôle dramatique radiophonique) - Flowspeech fonctionne bien en termes de "naturel", mais il existe encore un écart dans la "tension dramatique". Pour les utilisateurs qui ont besoin d'un doublage dialectal et que le dialecte ne figure pas dans la liste de support (comme le Hokkien, le Hakka, etc.), la version actuelle ne peut pas le satisfaire.

Résumé et Outlook

Flowspeech fournit une solution équilibrée entre qualité sonore, rapport coût-performance et richesse des fonctionnalités dans le domaine de la TTS chinoise. Le clonage vocal et le contrôle granulaire SSML constituent ses principales différences par rapport aux outils TTS de base. En termes de naturel de la prosodie dans la synthèse vocale chinoise, Flowspeech surpasse les produits anglophones tels que ElevenLabs, qui constitue son principal obstacle concurrentiel.

Limites actuelles : (1) Il y a encore place à l'amélioration pour maintenir la cohérence lors de la synthèse de textes longs : une légère dérive du timbre ou des fluctuations du débit de parole peuvent se produire dans de rares scénarios ; (2) La prise en charge des dialectes est actuellement limitée aux dialectes majeurs, et les dialectes des langues mineures ne sont pas encore pris en charge ; (3) Il y a encore place à l'amélioration dans la restauration détaillée des timbres clonés au niveau de la granularité syllabique ; (4) Les exigences de l'industrie TTS en matière d'identification et de traçabilité pour la parole générée par l'IA pourraient devenir plus strictes à mesure que les politiques réglementaires évoluent. Suggestions d'achat/d'adoption : les créateurs individuels commencent avec la version Pro et se concentrent sur le test de la cohérence des sons clonés sous la durée audio cible (5 minutes/30 minutes/2 heures). Pour les scénarios tels que la technologie éducative et le service client qui nécessitent une intégration API, il est recommandé de demander un essai de la version entreprise pour évaluer les capacités de prise en charge en temps réel et simultanée de la synthèse de streaming.

Outils associés : ÉquipageAI, langchain

Informations de version

  • Version bêta publique :Version bêta publique, prend en charge plus de 50 bibliothèques de sons, un éditeur SSML de clonage vocal et une génération TTS multilingue.
  • Version bêta interne :Pendant la phase de test interne, seules les fonctions TTS de base sont disponibles, dont 20 sons prédéfinis, et le clonage vocal n'est pas pris en charge.

Avis des utilisateurs

  • Chargement des avis...