Directeur de flux Gratuit

-

FlowDirector est un cadre de montage vidéo sans formation lancé par l'AGI Lab de l'Université Westlake et la Central South University. Il est basé sur une technologie de génération de flux d'édition basée sur l'équation différentielle ordinaire (ODE), combinée à des mécanismes de correction du flux d'attention spatiale (SAFC) et de guidage moyen différentiel (DAG) pour obtenir une édition de contenu vidéo de niveau sémantique de haute précision. Prend en charge des tâches telles que le remplacement d'objets, la conversion de texture, la modification d'attributs, etc., et peut être modifié à l'aide du modèle T2V pré-entraîné sans formation supplémentaire.

Directeur de flux Interface du produit

FlowDirecteur

Paramètres et statistiques de base

Projets Informations
Nom de l'outil Directeur de flux
Équipe de développement Laboratoire AGI de l'Université Westlake / Université Central South
Entrée centrale GitHub : github.com/Westlake-AGI-Lab/FlowDirector
Formulaire de livraison Cadre de recherche open source (Python)
Technologie de base Flux d'édition piloté par ODE (Editing Flow), SAFC, DAG
Licence Open source (voir le référentiel GitHub pour une licence spécifique)
Modèle de pré-formation requis Compatible avec le modèle grand public Text-to-Video (T2V)
Type d'édition Remplacement d'objet, conversion de texture, modification d'attribut, ajout/suppression d'objet

La principale contribution de FlowDirector est de résoudre deux problèmes de longue date dans le montage vidéo : l'incohérence temporelle et la distorsion structurelle. Les méthodes traditionnelles reposent sur l'inversion de l'espace latent, qui est sujette aux scintillements temporels et à la distorsion du contenu pendant le processus d'encodage de la vidéo dans l'espace latent, puis de décodage. FlowDirector modélise le processus d'édition directement dans l'espace de données et utilise des chemins de transition fluides pilotés par ODE pour éviter la perte d'informations causée par le mappage inverse.

Reconnaissance des utilisateurs et du marché

  • Impact académique : l'article a été publié sur arXiv (2506.05046), produit conjointement par l'AGI Lab de l'Université Westlake et la Central South University. Lors de plusieurs tests de référence en matière de montage vidéo, FlowDirector a obtenu des résultats exceptionnels dans trois indicateurs clés : suivi des instructions, cohérence temporelle et préservation de l'arrière-plan.
  • Écosystème Open Source : le code est open source sur GitHub et les développeurs de la communauté peuvent reproduire des expériences, des développements secondaires et vérifier les effets sur leurs propres ensembles de données. L'open source abaisse le seuil de vérification technique et d'autres équipes de recherche peuvent directement utiliser les résultats de FlowDirector à des fins de comparaison de base.
  • Comparaison avec des frameworks similaires : par rapport aux méthodes de montage vidéo existantes telles que InstructVideo, Video-P2P et TokenFlow, les principaux avantages de FlowDirector sont l'absence de formation (pas besoin d'affiner le modèle pour chaque vidéo) et la préservation de la structure (le flux ODE est naturellement plus stable que le mappage inverse). L’inconvénient est qu’il est actuellement davantage axé sur les prototypes de recherche et qu’il est encore loin des outils prêts à l’emploi au niveau des produits.

Avantage de coût

  • Entièrement Open Source et gratuit : les poids du code et des modèles sont disponibles sur GitHub, sans frais d'appel API. Les ressources informatiques requises dépendent des spécifications GPU de l'appareil en cours d'exécution : plus la mémoire est grande, plus la résolution et la fréquence d'images qu'elle peut gérer sont élevées.
  • Référence de comparaison : les outils de montage vidéo commerciaux (tels que Runway Gen-2, Pika Labs, Topaz Video AI) sont facturés à la seconde ou au mois, et le coût d'une tâche de montage de 30 secondes varie de quelques yuans à des dizaines de yuans. FlowDirector n'a aucun coût d'utilisation direct, mais vous devez supporter la surcharge de puissance de calcul du GPU. Si vous possédez déjà un périphérique GPU (RTX 4090 ou supérieur), le coût de l'électricité nécessaire à l'exécution d'une seule modification est négligeable ; si vous comptez sur la location de GPU cloud (AutoDL et autres plates-formes), le coût d'une seule modification est d'environ quelques yuans par heure.
  • Convient aux équipes sensibles aux coûts mais disposant de ressources GPU, ou aux utilisateurs qui doivent contrôler les coûts marginaux dans les scénarios d'édition par lots.

Fonctions principales

  • Édition sémantique précise : apportez des modifications au niveau sémantique au contenu vidéo en fonction des instructions en langage naturel. Par exemple, remplacez « ours » dans la vidéo par « dinosaure », ou changez « jour » par « nuit ». Le processus d'édition ne nécessite pas d'annotation manuelle d'images clés ni de traitement image par image.
  • Protection de la cohérence spatiale et temporelle : Maintenez la cohérence temporelle et l'intégrité de la structure spatiale de la vidéo pendant le processus de montage. C'est la principale compétitivité de FlowDirector : d'autres méthodes sont sujettes au scintillement de l'écran ou au désalignement du contenu lors du montage vidéo long. FlowDirector atténue ce problème dans une certaine mesure grâce au streaming ODE.
  • Édition locale et protection globale : sur la base du mécanisme SAFC (Spatial Attention Flow Correction), seule la zone cible liée à l'instruction d'édition est exploitée, et le contenu d'origine et l'état de mouvement des zones non cibles sont gelés. Les utilisateurs peuvent contrôler précisément « où changer » et « où ne pas changer », plutôt que de laisser l'IA deviner.
  • Montage sans train : utilisez directement des modèles texte-vidéo (T2V) pré-entraînés, sans avoir besoin d'une formation supplémentaire du modèle ou d'un réglage précis pour chaque vidéo ou chaque tâche d'édition. Le traitement d'une nouvelle vidéo ne nécessite qu'un seul passage, et les coûts en termes de temps et de puissance de calcul sont nettement inférieurs à ceux des méthodes nécessitant un réglage fin vidéo par vidéo.
  • Plusieurs types de support d'édition : couvre diverses tâches d'édition telles que le remplacement d'objets (voiture → dragon), la conversion de texture (cuir → métallique), la modification d'attributs locaux (changement de couleur de cheveux), l'ajout/suppression d'objets (ajouter un chapeau, supprimer une personne), etc.

Evolution du modèle et de la version

  • publication papier arXiv (juin 2025) : la solution technologique FlowDirector est divulguée pour la première fois, comprenant trois innovations principales : Editing Flow Generation, SAFC et DAG. Données d'évaluation publiées sur plusieurs critères de référence.
  • GitHub Open Source : le référentiel de code open source est synchronisé avec l'article, y compris le code d'inférence, les exemples de scripts et les interfaces d'appel de poids de pré-entraînement.
  • La version actuelle en est au stade du prototype de recherche et il n'existe pas de feuille de route de commercialisation. Les orientations des itérations ultérieures peuvent inclure : la prise en charge de résolutions plus élevées (actuellement limitées par la mémoire GPU), l'intégration de davantage de bases de modèles T2V, la réduction des besoins en ressources informatiques, etc.

Avantages techniques

  • Flux d'édition de l'espace de données : ne repose pas sur le mappage inverse de l'espace latent, calcule directement la différence de champ de vitesse entre la vidéo source et la vidéo cible dans l'espace de pixels d'origine et génère un chemin d'édition fluide. Cela évite fondamentalement la distorsion structurelle courante dans la méthode de mappage inverse - par exemple, la première est modifiée directement sur l'image d'origine, tandis que la seconde est compressée en une vignette, puis décompressée et modifiée à nouveau. La différence de perte d’informations est décisive.
  • Correction du flux d'attention spatiale (SAFC) : extrayez des cartes d'attention pertinentes pour la tâche d'édition et générez des masques spatiaux précis. Au cours du processus d'édition piloté par ODE, un masque est superposé au champ de vitesse, gelant les composants du champ de vitesse dans les zones non ciblées et protégeant l'état d'origine de l'arrière-plan et des zones non pertinentes. Compréhension intuitive de SAFC : le modèle sait où concentrer son attention et ne change que la zone « focalisée ».
  • Differential Average Guidance (DAG) : Inspiré du Classifier-Free Guidance, il génère plusieurs flux d'édition candidats et calcule le signal de différence entre eux, en utilisant le signal de différence pour améliorer la précision de l'alignement sémantique. Explication : Plutôt que de se fier aux résultats d'une seule vérification, il est préférable de trouver la « direction consensuelle » parmi plusieurs solutions candidates afin de réduire les biais aléatoires.

Comment utiliser

L'utilisation de FlowDirector est orientée vers la recherche et la vérification technique et n'est pas intégrée dans une application Web.

OBTENIR LE CODE :

clone git https://github.com/Westlake-AGI-Lab/FlowDirector.git

Dépend de l'environnement : -Python 3.8+

  • PyTorch (2.0 ou supérieur recommandé)
  • CUDA (11.8 ou supérieur recommandé)
  • Poids du modèle T2V pré-entraînés

Étapes typiques :

  1. Configurez l'environnement Python et installez les dépendances selon le README de l'entrepôt.
  2. Téléchargez le point de contrôle du modèle T2V pré-entraîné compatible.
  3. Préparez-vous à saisir la vidéo et à modifier le texte des instructions.
  4. Exécutez le script d'édition : spécifiez le chemin vidéo d'entrée, l'invite d'édition, le chemin de sortie et la configuration des paramètres.
  5. Attendez la fin de l'inférence et affichez les résultats de l'édition dans le répertoire de sortie.

Description du seuil technique : FlowDirector s'adresse actuellement aux chercheurs et ingénieurs ayant une formation en apprentissage profond. Si vous avez besoin de le rendre pratique, vous pouvez envisager de l'encapsuler dans une interface Web Streamlit ou Gradio, ou de l'intégrer dans l'écosystème de nœuds ComfyUI.

Prix des produits

Projet Descriptif
Licence de logiciel Complètement Open Source et Gratuit
Ressources informatiques Besoin d'apporter votre propre GPU (RTX 4090 ou supérieur recommandé)
Solution GPU cloud Le coût de location est d'environ 2 à 8 yuans/heure (selon les spécifications de l'instance), et une seule modification prend plusieurs minutes à des dizaines de minutes
Licence commerciale Veuillez vérifier les termes de licence open source spécifiques du référentiel GitHub

Par rapport aux API de montage vidéo commerciales (telles que la facturation à la seconde de Runway), FlowDirector présente un avantage marginal en termes de coût dans les scénarios de montage par lots et à haute fréquence : après un investissement fixe en puissance de calcul, le coût supplémentaire du montage supplémentaire approche de zéro.

Scénarios d'application

  • Production d'effets spéciaux vidéo : utilisez des commandes de texte pour remplacer les objets ordinaires de la vidéo par des éléments d'effets spéciaux. Au début de la phase de validation de principe de l'industrie du cinéma et de la télévision, FlowDirector peut être utilisé pour générer rapidement des échantillons afin d'évaluer les effets de montage, sans que les artistes d'effets spéciaux consacrent des heures de travail à chaque version des échantillons.
  • Itération rapide des vidéos publicitaires : ajustez rapidement le contenu vidéo en fonction des changements de rédaction - remplacez l'apparence du produit, modifiez le contexte d'arrière-plan. Les agences de publicité peuvent exécuter des échantillons comparatifs de plusieurs ensembles de plans d'édition en même temps, sélectionner le meilleur plan, puis passer à l'étape de production fine.
  • Matériaux d'animation et de jeu : modifiez rapidement l'apparence des personnages ou le style de scène dans les courts métrages d'animation, réduisant ainsi la charge de travail de réglage manuel image par image. Convient aux animateurs indépendants et aux petits studios de jeux pour vérifier rapidement les solutions visuelles dès les premiers stades du prototypage.
  • Production de contenu vidéo court : les créateurs de contenu apportent des modifications créatives secondaires aux supports vidéo existants, transformant des paysages ordinaires en un style cyberpunk et ajoutant des éléments fantastiques aux vidéos réelles. Un montage prend plusieurs minutes à dix minutes, ce qui est un à deux ordres de grandeur plus rapide que le traitement image par image traditionnel.
  • Montage vidéo personnalisé : les utilisateurs individuels peuvent modifier des éléments des vidéos d'animaux de compagnie et des courts métrages de voyage selon leurs propres idées créatives pour les rendre plus intéressants. La prise en charge des périphériques GPU est requise, mais aucune compétence professionnelle n'est requise pour le processus d'édition.

Personnes concernées

  • Chercheurs en IA et ingénieurs en vision par ordinateur : groupe d'utilisateurs cible de FlowDirector. Vous pouvez reproduire les résultats de l'article, améliorer l'algorithme basé sur le code source et vérifier l'effet d'édition sur votre propre ensemble de données.
  • Artiste d'effets spéciaux en post-production cinématographique et télévisuelle : personnel technique d'effets spéciaux qui s'intéresse à la technologie de montage vidéo IA et souhaite l'intégrer dans son flux de travail. Une certaine base Python est nécessaire pour le configurer et l'utiliser, mais les effets d'édition peuvent être intégrés dans les premières propositions créatives.
  • Créateurs de contenu IA et développeurs indépendants : personnes disposant de ressources GPU et souhaitant essayer une technologie de montage vidéo de pointe. La qualité d'édition de FlowerDirector est au premier niveau parmi les méthodes équivalentes sans formation et convient comme composant de base des pipelines de traitement vidéo par lots.

Limites non applicables :

  • Scénarios nécessitant une vitesse de traitement en temps réel ou quasi réel. - L'inférence FlowDirector prend quelques minutes et n'est pas adaptée à la diffusion en direct ou à l'édition en temps réel.
  • Il existe des exigences extrêmes en matière de qualité d'image de 4K et supérieure - actuellement limitée par la mémoire GPU, la résolution de sortie est limitée.
  • Utilisateurs non techniques - Actuellement, il n'est pas fourni en tant que produit Web et le seuil pour les opérations en ligne de commande et la configuration limitée à Python est élevé.
  • Projets qui ont des exigences strictes en matière de droits d'auteur commerciaux sur les résultats de sortie - la propriété des droits d'auteur sur le contenu généré/édité par l'IA reste une zone grise juridique.

Résumé et Outlook

FlowDirector propose une solution technique simple et efficace dans le domaine du montage vidéo - en utilisant le flux ODE de l'espace de données pour remplacer le mappage inverse de l'espace latent, ce qui résout les problèmes d'incohérence temporelle et de distorsion structurelle au niveau architectural. SAFC et DAG améliorent respectivement la fiabilité dans les deux dimensions du « positionnement précis de la zone d'édition » et de « l'alignement sémantique amélioré ». Pour les chercheurs, il s’agit d’un cadre de référence avec des idées claires ; pour les équipes qui souhaitent mettre en œuvre des capacités de montage vidéo dans des projets réels, cela prouve que la qualité du montage vidéo sans formation peut atteindre des niveaux pratiques.

Limites actuelles :

  • Il s'agit encore d'un prototype de recherche et n'a pas été présenté sous forme de produit pouvant être déployé commercialement.
  • Les exigences en matière de mémoire GPU sont élevées, ce qui limite la résolution vidéo et le nombre d'images pouvant être traitées.
  • Les utilisateurs doivent apporter leurs propres capacités techniques pour configurer l'environnement, ajuster les paramètres et résoudre les problèmes.

Points d'observation de suivi :

  • Qu'une équipe l'encapsule en tant que nœud ComfyUI ou service Web - cela déterminera directement le degré de praticité.
  • La prise en charge de vidéos à plus haute résolution et plus longues - cela détermine si elles peuvent entrer dans le processus de production cinématographique et télévisuelle.
  • Le nombre de contributions communautaires et de forks - reflète la santé de l'écosystème open source.

Outils associés : runway, pika

Informations de version

  • version initiale :La version publique initiale prend en charge le mécanisme de protection local SAFC d'édition vidéo sémantique précise et l'amélioration sémantique DAG basée sur le flux d'édition ODE.
  • Version papier :Le document arXiv est publié, révélant des détails techniques et des résultats de référence.

Avis des utilisateurs

  • Chargement des avis...