Tutoriel niveau nounou sur la production vidéo numérique en direct : du scénario au film multilingue

🛒 Pour les nouveaux arrivants dans les opérations et le contenu, nous vous aiderons à réaliser une production à guichet unique, de la sélection du sujet à la production de films multilingues.

Objectifs du didacticiel

Ce didacticiel prend HeyGen comme exemple pour vous aider à partir d'un script, à réaliser une vidéo de diffusion vocale numérique publiable et à apprendre à produire par lots des versions multilingues. Suivez simplement les étapes tout au long du processus, aucune expérience d'édition n'est requise.

Liste de contrôle de préparation

  • [ ] Enregistrez un compte HeyGen (ou des outils similaires, tels que Synthesia) et confirmez le quota gratuit.
  • [ ] Préparez un script parlé de 100 à 200 mots (peut être généré avec l'aide de l'IA).
  • [ ] Déterminez le but et le format de la vidéo : la version horizontale (16:9) convient à Bilibili/YouTube, et la version verticale (9:16) convient à Douyin/Video Account/Kuaishou.
  • [ ] Préparer les supports liés à la marque (logo, image d'arrière-plan, copie des sous-titres parlés).
  • [ ] Confirmez la source de l'image que vous utilisez : l'image propre de la plateforme, ou le matériel son/image que vous avez autorisé.

Étape 1 : Écrivez un script parlé

Le scénario de la diffusion orale suit la structure « accroche – corps – appel à l’action » :

[Hook] Beaucoup de gens pensent qu'il est difficile de réaliser de courtes vidéos, mais en fait, il n'y a qu'une seule méthode.
[Texte] Aujourd'hui, utilisez 3 étapes pour transformer un texte en vidéo parlée...
[CTA] Si vous souhaitez apprendre systématiquement, répondez "tutoriel" dans la zone commentaire et je vous enverrai la liste complète.

Points d'écriture :

  • Chaque phrase doit être limitée à 20 mots pour faciliter la diffusion orale et les sous-titres.
  • Soyez familier et évitez les accents écrits et les longues clauses.
  • Indiquez où des « pauses clés » ou « l'accentuation des sous-titres » sont nécessaires.

Exemple de modèle de script de diffusion orale (peut être appliqué directement)

[Hook] La plus grande crainte lors de la création de contenu n'est pas de ne pas pouvoir l'écrire, mais que personne ne le lise une fois que vous l'aurez écrit.
[Pain Point] Avez-vous déjà rencontré : rester éveillé tard pour écrire un script et l'enregistrer des dizaines de fois, mais le nombre de vues est toujours à deux chiffres ?
[Méthode] Aujourd'hui, je vais partager une méthode : utiliser d'abord l'IA pour produire des manuscrits par lots, puis utiliser des humains numériques pour produire des films par lots. Vous pouvez produire l’équivalent d’une semaine de travail en une seule journée.
[Détails] Premièrement, la sélection du sujet doit utiliser « points douloureux + scénarios » ; deuxièmement, le scénario doit être court et familier ; troisièmement, utilisez une image unifiée pour générer et établir en continu des points de mémoire.
【CTA】Vous souhaitez obtenir le modèle de script complet ? Répondez « Digital Man » dans la zone de commentaire et je vous enverrai le modèle.

Cette structure convient à la plupart des scénarios de diffusion orale tels que l'introduction de produits, la vulgarisation des connaissances, la promotion d'événements, etc., et peut être utilisée directement pour remplacer le contenu.

Étape 2 : Générer une vidéo humaine numérique

  1. Entrez « Créer une vidéo » de HeyGen et sélectionnez « Avatar (Digital Human Image) ».
  2. Sélectionnez le format horizontal ou vertical.
  3. Collez le script dans la zone de texte et définissez la langue (chinois par défaut).
  4. Sélectionnez l'image et la voix : donnez la priorité à l'image par défaut de « parole naturelle et forme de bouche claire ».
  5. Cliquez sur Générer et attendez la génération (généralement quelques minutes).

Points de contrôle : si la forme de la bouche est correcte, si la vitesse de parole est naturelle et s'il y a une pause évidente à la fin.

Étape 3 : Ajustez la voix et la vitesse de parole

  • Vitesse de parole : la valeur par défaut est 1,0, elle peut être ajustée à 1,1-1,2 pour le transport de marchandises/produits secs, mais ne dépassez pas 1,3, sinon la forme de la bouche sera facilement désynchronisée.
  • Pause : insérez une virgule/un point dans le script pour briser naturellement la phrase ; commencez une nouvelle phrase sur laquelle vous devez insister.
  • Changer les sons : Si vous n'êtes pas satisfait, régénérez-vous après avoir changé la liste des sons.

Étape 4 : Ajouter des sous-titres et un arrière-plan

  1. Activez « Sous-titres automatiques » et sélectionnez le style et la position des sous-titres.
  2. Ajoutez un arrière-plan : Vous pouvez utiliser une couleur unie, une image de marque ou un arrière-plan flou.
  3. Ajoutez le logo de la marque et le guide d'action final (peut être traité ultérieurement dans un logiciel d'édition).

Suggestion de sous-titres : utilisez les couleurs surlignées pour les chiffres clés et le CTA afin d'augmenter le taux d'achèvement.

Étape 5 : Génération de lots multilingues

  1. Copiez la vidéo originale dans le projet et sélectionnez « Régénérer ».
  2. Basculez la langue vers la langue cible (telle que l'anglais, le japonais).
  3. Utilisez la traduction de la plateforme ou collez le texte traduit après une relecture manuelle (cette dernière est recommandée pour une qualité supérieure).
  4. Exportez toutes les versions linguistiques par lots.

Remarque : Assurez-vous de vérifier la prononciation et la terminologie après la traduction pour éviter une « traduction littérale » qui pourrait nuire au sens de la marque.

Étape six : conformité et adaptation de la plateforme

Vérifiez avant de poster :

  • [ ] Activez l'annotation "Contenu généré par l'IA" (comme requis par la plateforme).
  • [ ] Le scénario de diffusion orale ne contient pas de termes absolus ni de promesses illégales (loi sur la publicité).
  • [ ] Les images et sons utilisés proviennent de sources autorisées.
  • [ ] Export selon les spécifications de la plateforme cible (version verticale Douyin 1080×1920, version horizontale Site B 1920×1080).

Étape 7 : Publication et examen des données

  1. Après la publication, concentrez-vous sur le taux d'achèvement, le taux de rebond en 3 secondes et le taux d'interaction.
  2. Comparez les données de différentes images, vitesses de parole et couvertures.
  3. Écrivez les commentaires sur les données dans la bibliothèque de scripts et itérez le lot suivant.

Suggestions de post-tempo

  • Période de démarrage : 3 à 5 articles par semaine, testant différents crochets et images.
  • Période stable : correction de 2 à 3 articles par semaine, en se concentrant sur des orientations de sélection de sujets surperformantes.
  • Tableau de révision : enregistrez la vidéo, la lecture, l'achèvement, l'interaction et la conversion de chaque vidéo, et vérifiez la tendance toutes les deux semaines.

Spécifications de dénomination et d'archivage des matériaux

{Date}_{Série}_{Version}_{Langue}.mp4
Exemple : 20260815_Introduction au produit_v2_zh.mp4

La dénomination unifiée rend la collaboration en équipe et la gestion multilingue plus efficaces et évite la confusion de la « version finale v3 ».

Vérification rapide des spécifications des canaux

Plateforme Cadre recommandé Durée recommandée Remarques
Douyin/Compte vidéo 9:16 version verticale 30-60 secondes Les 3 premières secondes du crochet sont les plus importantes
Station B/YouTube Version horizontale 16:9 1-3 minutes Haute densité d'informations, des sous-titres peuvent être ajoutés
Petit livre rouge 9h16 Verticale 40-90 secondes Couverture et titre tous deux importants

Avant d'exporter, sélectionnez les spécifications correspondantes en fonction de la plateforme cible pour éviter la perte de qualité d'image causée par un recadrage secondaire.

Méthode de vérification

  • Vérification 1 : La forme et la prononciation de la bouche vidéo générée sont fondamentalement alignées.
  • Vérification 2 : Il n'y a aucune faute de frappe dans les sous-titres et les informations C-bit sont lisibles.
  • Vérification 3 : La version multilingue a été vérifiée de manière aléatoire et ne présente aucune erreur de traduction.
  • Vérification 4 : Le film terminé a été annoté par l'IA et est conforme aux règles de la plateforme.

Erreurs et précautions courantes

  1. Le script est trop long : un seul script doit être limité à 60 à 90 secondes de lecture orale (environ 250 à 350 mots). Si c’est trop long, cela finira facilement.
  2. La vitesse de parole est trop rapide : au-dessus de la vitesse 1,3x, la forme de la bouche est facile à effondrer. Il est préférable de laisser l'utilisateur le lire lui-même à une vitesse de 1,25x.
  3. Traduction littérale multilingue : les versions étrangères doivent être relues par des locuteurs natifs pour éviter une traduction rigide.
  4. Contenu IA non étiqueté : ignorer l'étiquetage risque de voir votre compte banni, alors assurez-vous de le vérifier lors de la publication.
  5. Confusion matérielle : créez des dossiers de scénario, de matériel et de film fini pour chaque série, et nommez-les avec la date et la version.

Foire aux questions et dépannage (FAQ)

  1. La génération est trop lente ou en file d'attente ?

    Les files d'attente sont normales pendant les périodes de pointe et peuvent être générées par lots à l'avance ; vous devez attendre ou effectuer une mise à niveau une fois le quota gratuit épuisé.

  2. La forme de la bouche n'est pas correcte et la voix est maladroite ?

    Resélectionnez une image et une voix plus naturelles, ramenez la vitesse de parole à 1,0 et divisez les phrases en phrases plus courtes.

  3. La vidéo est sous-titrée mais la plateforme les ajoute automatiquement. Est-ce que cela se répète ?

    Désactivez les sous-titres en ligne lors de l'exportation ou utilisez plutôt les « sous-titres automatiques » de la plateforme.

  4. L'image humaine numérique ressemble à un étranger et la forme de la bouche chinoise est bizarre ?

    La priorité est donnée aux images optimisées en chinois ; les images personnalisées nécessitent l’enregistrement de matériel chinois.

  5. A-t-il été jugé comme étant traité ou de mauvaise qualité par la plateforme ?

Garantissez des scripts originaux, des images différenciées (ajoutez des matériaux réels/des transitions animées) et standardisez la génération d'IA.

  1. Comment tester plusieurs images à moindre coût ?

    Utilisez le même script pour générer respectivement 2 à 3 versions de l'image et utilisez un petit budget pour comparer les données avant de les mettre à l'échelle.

Résumé et prochaines étapes

À ce stade, vous avez été capable de produire de manière indépendante une vidéo de diffusion vocale numérique publiable et de maîtriser les points clés de la production de masse multilingue et de la conformité. Il est recommandé de vérifier d'abord 3 à 5 éléments par petits lots et d'utiliser des données réelles (achèvement, interaction, conversion) pour comparer différentes images et styles de script ; après avoir testé un modèle stable, vous pouvez alors envisager de personnaliser les humains numériques ou les lignes de production programmatiques.

Avancement et expansion

  • Humain numérique personnalisé : enregistrez une image et une voix exclusives pour améliorer la reconnaissance de la marque.
  • Personnes numériques de diffusion en direct : de l'enregistrement et de la diffusion au service client et à la livraison interactifs en temps réel.
  • Production programmée : utilisation d'une bibliothèque de scripts + génération programmée + release automatique pour former une chaîne d'assemblage.
  • Matrice de contenu : plusieurs comptes, plusieurs langues et plusieurs combinaisons d'images, et sélection de sujets de retour de données.

Avis des utilisateurs

  • Chargement des avis...