Texte de flux Gratuit

-

FLUX-Text est un modèle de transformateur de diffusion open source pour l'édition de texte de scène (Scene Text Editing). Il prend en charge la modification, l'ajout et la réparation de textes multilingues. Il convient aux scénarios de traitement d'images et de texte tels que l'édition d'affiches, la production d'émoticônes et la conception publicitaire.

Texte de flux Interface du produit

FLUX-Texte

FLUX-Text (Flux Text) est un modèle d'édition de texte de scène multilingue (Scene Text Editing, STE) open source par l'équipe d'apprentissage automatique AMAP. Il se concentre sur la modification, l’effacement ou l’ajout d’un nouveau texte au texte existant dans les images. Différent des modèles graphiques à usage général (tels que Stable Diffusion et Midjourney), la capacité principale de FLUX-Text est de « contrôler avec précision le contenu du texte dans l'image » - les utilisateurs peuvent spécifier de changer le titre chinois sur l'affiche en anglais, de modifier le texte de la bulle de texte dans le paquet d'émoticônes ou de remplacer le texte du prix sur l'image du produit - et les résultats de la modification maintiennent une intégration naturelle visuellement, ne laissant aucune trace d'édition.

Paramètres et statistiques de base

Éléments de paramètres Spécifications
Nom du produit FLUX-Texte
Catégorie Édition d'images AI/Édition de texte de scène
Formulaire de livraison Modèle open source (poids pré-entraînés + code d'inférence)
Licence open source Soumis au référentiel officiel
Architecture modèle Transformateur de diffusion (DiT)
Langues prises en charge Chinois, anglais et autres langues
Tâches principales Édition de texte de scène (modifier/ajouter/effacer du texte dans les images)
Propriété du projet Équipe AMAP ML (Alibaba / AMAP)
Article publié arXiv (2025-05)
Plateforme Open Source GitHub + Visage câlin
Environnement de démonstration Démo Gradio
Équipe de recherche Rui Lan et coll.

La différence fondamentale entre FLUX-Text et les modèles de dessin de texte à usage général : les logiciels de dessin P et les outils d'image IA à usage général ne peuvent généralement effectuer que du "redessin d'image entière" lors du traitement du texte dans les images, et ne peuvent pas contrôler avec précision la modification de zones de texte spécifiques - ils peuvent changer l'arrière-plan, les caractères ou la composition. FLUX-Text fonctionne uniquement sur la zone de texte spécifiée, laissant les autres parties de l'image inchangées. Cela le rend irremplaçable dans des scénarios tels que l'édition d'affiches, la modification de publicités, la production de packs d'expressions, la mise à jour du prix de l'image d'un produit, etc. qui nécessitent de « changer uniquement les mots mais pas l'image ».

Reconnaissance des utilisateurs et du marché

En tant que projet académique open source, l'influence de FLUX-Text se reflète principalement dans la communauté de recherche et la communauté open source. L'article a été publié sur arXiv (2025-05) et a reçu une certaine attention dans le domaine de recherche subdivisé de l'édition de texte de scène (STE). Le référentiel GitHub fournit un code d'inférence complet et des poids pré-entraînés, et la démo Gradio hébergée sur Hugging Face permet aux utilisateurs de découvrir les effets du modèle en ligne.

À l'heure actuelle, FLUX-Text n'a pas encore constitué un large marché d'utilisateurs finaux - son public principal est constitué de chercheurs et de développeurs en IA, plutôt que de cibler directement les consommateurs finaux C. La forme du produit est un modèle open source plutôt qu'une plateforme SaaS, ce qui signifie que les utilisateurs doivent disposer de certaines capacités techniques (configuration de l'environnement Python, téléchargement de modèle et inférence) pour l'utiliser. Il est recommandé que les principaux indicateurs de reconnaissance du marché - le nombre de citations d'articles, les étoiles GitHub et les téléchargements de Hugging Face - soient basés sur les données en temps réel de chaque plate-forme, et aucune citation spéculative ne sera faite ici.

Avantage de coût

Dimension du coût Descriptif
Licence de logiciel 0 $ (modèle open source, soumis à licence officielle)
Calcul d'inférence GPU requis (16 Go + VRAM recommandés), la location de GPU cloud est d'environ 0,5 à 2 $/heure
Déploiement et exploitation Nécessite la configuration de l'environnement Python et PyTorch
Service API Aucune API hébergée officielle ; Gradio Demo est destiné à des fins de recherche et de démonstration

Les principaux avantages financiers du modèle open source : zéro frais de licence + entièrement personnalisable. Comparé aux SaaS commerciaux d'édition d'images (tels qu'Adobe Firefly, Canva AI) basés sur un abonnement (10-60 $/mois), FLUX-Text convient aux équipes disposant de capacités techniques pour le déploiement privé et le traitement par lots. Pour un scénario de commerce électronique qui doit traiter le remplacement de texte pour 1 000 images de produits chaque jour, le coût marginal de l'auto-déploiement de FLUX-Text est principalement la puissance de calcul du GPU (environ 15 à 30 $/jour), tandis que le coût de l'achat en gros de services commerciaux d'édition d'IA est généralement de 100 à 500 $/jour.

Coûts cachés : l'inférence de modèle nécessite des ressources GPU (16 Go + VRAM recommandés), qui ne peuvent pas être utilisées directement par des utilisateurs non techniques ; le modèle n'est peut-être pas idéal pour éditer des polices non conventionnelles (telles que l'écriture manuscrite, le word art) ; la version actuelle ne prend pas en charge l'édition de texte de scène dans les vidéos.

Fonctions principales

  • Modification du texte de la scène : Remplacez le contenu du texte dans la zone spécifiée de l'image par le texte cible. Par exemple : remplacez la « Conférence du printemps 2025 » dans l'affiche par « Promotion d'été 2025 », et le modèle correspond automatiquement au style de police, à la taille de la police, à la couleur et à l'angle de perspective du texte d'origine, permettant au texte modifié de se fondre visuellement de manière transparente dans l'arrière-plan.
  • Effacement du texte de la scène : effacez les zones de texte indésirables de l'image et remplissez les zones effacées avec un contenu d'arrière-plan raisonnable. Par exemple : supprimez le texte du logo de la marque des images de produits et supprimez les horodatages des captures d'écran. Les résultats de l'effacement dépendent de la complexité de l'arrière-plan : l'effacement fonctionne mieux avec une couleur unie ou un arrière-plan à texture uniforme.
  • Nouveau texte de scène : insérez le texte spécifié dans les zones vides des images (telles que les murs, les bannières, les étiquettes). La position du nouveau texte est spécifiée par l'utilisateur (marquée par un cadre ou un masque rectangulaire), et le modèle détermine automatiquement la relation de perspective et les conditions d'éclairage de la zone et génère des effets de texte qui y correspondent.
  • Prise en charge multilingue : prend en charge l'édition de texte de scène en chinois et en anglais. Les deux langues sont traitées selon le même cadre modèle, et les textes chinois et anglais peuvent être mélangés et modifiés dans la même image.
  • Migration du style de police par défaut : lors de l'édition de texte, le modèle extrait automatiquement le style de police du texte original (serif/sans-serif, épaisseur et angle d'inclinaison) et l'applique au texte cible, sans que l'utilisateur ait besoin de le spécifier manuellement.
  • Cohérence de l'arrière-plan : Le contenu de l'image en dehors de la zone d'édition n'est pas du tout modifié - FLUX-Text ne fonctionne que sur la zone de texte spécifiée par l'utilisateur. C'est sa principale différence avec les modèles généraux d'édition d'images (ces modèles ont tendance à « modifier » les zones environnantes).

Evolution du modèle et de la version

Version Date de sortie Changements clés
v0.9 (version de recherche) 2025-05-06 Publier l'article arXiv et le code de raisonnement initial pour vérifier la faisabilité de l'édition de texte de scène
v1.0 (version officielle) 2025-07-04 Ouvrez la démo Gradio et les poids de pré-entraînement, prenez en charge l'édition de texte de scène multilingue

Les enregistrements de version sont soumis à la version officielle de GitHub et aux versions papier d'arXiv. La direction itérative de FLUX-Text est pilotée par l'équipe de recherche sur la base des commentaires de la communauté et des progrès techniques. Il n’existe actuellement aucune feuille de route pour la version publique.

Avantages techniques

  • Architecture du transformateur de diffusion (DiT) : FLUX-Text est basé sur le transformateur de diffusion au lieu du modèle de diffusion traditionnel U-Net. L'architecture DiT surpasse les modèles U-Net similaires en termes de qualité de génération d'images, produisant des bords de texte plus clairs et des effets de fusion de textures plus naturels. Le modèle utilise des données de paires image-texte à grande échelle + des données d'édition de texte spécialisées (y compris des images appariées avant/après l'édition) lors de l'entraînement.
  • Mécanisme d'attention sensible au texte : le modèle introduit le biais d'attention de la zone de texte pendant le processus de diffusion - lors de l'inférence, le modèle accorde plus d'attention à la cohérence des pixels de la zone d'édition spécifiée par l'utilisateur, tout en gardant les caractéristiques de la zone de non-édition inchangées. Cela élimine le problème de « fuite de diffusion » (les pixels en dehors de la zone d'édition étant accidentellement modifiés) aux limites d'édition.
  • Perspective et adaptation géométrique : Pour le texte oblique qui n'est pas filmé de face (comme le texte en perspective sur l'emballage du produit), le modèle détecte automatiquement les paramètres de transformation géométrique (rotation, mise à l'échelle, matrice de perspective) de la zone de texte, et applique la même transformation lors de la génération du texte cible, afin que le texte édité soit visuellement cohérent avec l'angle de perspective d'origine.
  • Saisie de contrôle conditionnelle : les utilisateurs peuvent spécifier avec précision la zone d'édition via un masque de texte (masque binaire) ou utiliser une boîte rectangulaire pour une annotation approximative. La saisie masquée permet des zones d'édition de forme arbitraire, tandis que les boîtes rectangulaires offrent un moyen plus pratique d'interagir.
  • Stratégie de données de formation : le modèle utilise une stratégie de formation hybride de données synthétiques + données de scène réelles. Les données synthétiques couvrent un grand nombre de changements de police, d'arrière-plan et de perspective pour garantir la polyvalence du modèle ; les données de scènes réelles (images réelles contenant du texte collecté sur Internet) améliorent la capacité de généralisation du modèle dans des environnements réels.

Comment utiliser

Comment utiliser Entrée Instructions
Démo Gradio Étreindre les espaces du visage Expérience en ligne, aucun déploiement local requis (il y a une file d'attente à attendre)
Inférence locale Dépôt GitHub Code de clonage → Installer les dépendances → Télécharger les poids → Exécuter le script d'inférence
Lire le journal arXiv Comprendre les détails techniques et l'évaluation expérimentale
Poids du modèle Visage câlin Télécharger des poids pré-entraînés pour l'inférence locale

Processus d'utilisation typique (déploiement local) :

clone git https://github.com/AMAP-ML/FluxText
cdFluxTexte
pip install -r exigences.txt
python run.py --input image.jpg --mask mask.png --target_text "Nouveau contenu textuel"

Conditions de saisie : une image originale contenant du texte + une image de masque (ou des coordonnées de cadre rectangulaire) identifiant la zone d'édition + le contenu du texte cible. Sortie : fichier image modifié.

Prix des produits

Modèle d'utilisation Honoraires Descriptif
Démo Gradio (expérience en ligne) Gratuit Utilisation des démonstrations de recherche, restrictions d'utilisation et files d'attente
Déploiement local (auto-hébergé) 0 $ (logiciel) + coût de la puissance de calcul du GPU Le logiciel est gratuit et open source, seuls les coûts du matériel ou du GPU cloud sont pris en charge
Utilisation commerciale Soumis aux termes de la licence open source Confirmer les contraintes du type de licence sur le scénario commercial

Pour les chercheurs individuels et les passionnés d'IA, Gradio Demo peut répondre aux besoins occasionnels d'édition de texte d'image, mais est limité par les limitations de file d'attente et de concurrence. Le déploiement local est recommandé pour une utilisation par lots dans les environnements de production, et le coût de location du GPU cloud est d'environ 0,5 à 2 $/heure (selon le modèle de GPU).

Scénarios d'application

  • Modification par lots des affiches et des images publicitaires : L'équipe marketing modifie fréquemment les informations sur la date, le prix et l'événement dans l'affiche avant et après les grandes promotions. Utiliser FLUX-Text pour remplacer du texte par lots est 10 à 50 fois plus efficace que de les modifier manuellement un par un dans PS. Méthode de vérification : comparez la précision de la modification par lots (la position/taille/angle du texte est conforme à l'image originale) et le taux de correction manuelle.
  • Mise à jour du prix et des paramètres de l'image du produit : L'équipe d'exploitation du commerce électronique met régulièrement à jour le prix, l'étiquette promotionnelle et les paramètres de spécification sur l'image principale du produit. FLUX-Text peut remplacer avec précision les numéros de prix dans une zone spécifiée, laissant l'arrière-plan et les autres éléments visuels inchangés. Méthode de vérification : indique si le taux de clics et le taux de conversion de l'image du produit édité sur la plateforme sont affectés par les traces d'édition.
  • Création graphique d'émoticônes et de réseaux sociaux : les créateurs de contenu peuvent modifier le contenu des bulles de texte dans les émoticônes et remplacer le texte du dialogue dans les captures d'écran. Méthode de vérification : si les traces d'édition sont visuellement détectables.
  • Désensibilisation des documents et des captures d'écran : utilisez FLUX-Text pour effacer les informations sensibles (nom, numéro de téléphone, e-mail, etc.) avant de partager des captures d'écran de documents internes, ce qui est plus naturel qu'une mosaïque manuelle. Méthode de vérification : Évaluation du caractère naturel du remplissage du fond dans les zones effacées.
  • Remplacement des sous-titres de films et de jeux : remplacez le texte dans les images vidéo (par exemple, en remplaçant le chinois par l'anglais dans l'interface utilisateur du jeu), qui doit être traité image par image. Remarque : La version actuelle est destinée à l'édition d'images uniques et le traitement vidéo doit être effectué image par image.

Personnes concernées

Foule Valeur d'adaptation Conditions préalables
Chercheur en IA Algorithme d'édition de texte de scène de recherche, qui peut être utilisé comme comparaison de base Environnement Python + PyTorch
Équipe d'exploitation et de conception de commerce électronique Modification par lots des images de produits et du texte de l'affiche Des étudiants techniques sont nécessaires pour aider au déploiement ou à l'utilisation de Gradio Demo
Créateur de contenu Packs d'émoticônes, graphiques de réseaux sociaux et modification de texte Gradio Demo suffit pour une utilisation légère
Équipe de désensibilisation des données Effacement des informations sensibles dans les captures d'écran des documents Un déploiement local est requis pour traiter de grandes quantités de données
Ne convient pas à la foule Raisons
--- ---
Utilisateurs ordinaires sans formation technique L'utilisation native nécessite une opération en ligne de commande
Scènes nécessitant un montage vidéo Actuellement, seules les images uniques sont prises en charge et les vidéos doivent être traitées image par image
Des conceptions professionnelles qui ont des exigences extrêmement élevées en matière de restauration de polices Le degré de restauration des polices non standard peut être insuffisant

Résumé et Outlook

FLUX-Text fournit une solution open source de haute qualité dans le domaine de niche hautement spécialisé de l'édition de texte de scène (STE). Sa valeur fondamentale réside dans le « contrôle précis du contenu du texte dans l'image sans affecter les autres éléments visuels » - dans le passé, cela nécessitait soit que les concepteurs professionnels traitent manuellement pixel par pixel (une seule image prenait 15 à 60 minutes), soit ne pouvait être obtenu qu'indirectement en redessinant l'image entière, mais était incontrôlable. FLUX-Text réduit le temps requis pour cette opération à quelques secondes tout en conservant la qualité visuelle de qualité professionnelle des résultats d'édition.

Limites actuelles : (1) L'inférence de modèle nécessite des ressources GPU (16 Go+ VRAM recommandés), ce qui affaiblit l'avantage du « seuil zéro » de l'open source : les utilisateurs sans matériel approprié ne peuvent avoir qu'une expérience limitée via Gradio Demo ; (2) L'effet d'édition de texte sur les polices non conventionnelles (écriture manuscrite, polices artistiques, polices décoratives) est instable - la couverture des données d'entraînement du modèle sur ces polices peut être insuffisante ; (3) Actuellement, ne prend en charge que le traitement d'une seule image et ne prend pas en charge les pipelines de traitement par lots ni l'édition de texte de scène vidéo ; (4) Il peut y avoir des défauts visuels subtils (tels que des traits discontinus et des écarts de couleur) dans le texte produit par le modèle, qui peuvent être remarqués lors de la visualisation agrandie. Suggestions d'achat/d'adoption : les équipes de commerce électronique et de marketing recommandent d'effectuer d'abord des tests par lots sur un petit nombre d'images réelles (50 à 100 images) pour évaluer si la qualité d'édition répond aux exigences commerciales en matière de précision et de naturel visuel. Les équipes de recherche peuvent télécharger directement les poids et le code pour affiner leurs propres ensembles de données. Les instructions de suivi incluent : l'optimisation de la vitesse d'inférence du modèle (prenant en charge le traitement par lots), la prise en charge d'un plus grand nombre de langues et l'intégration avec d'autres fonctionnalités d'édition d'images (telles que le remplacement de l'arrière-plan + les opérations combinées d'édition de texte).

Outils associés : ÉquipageAI, langchain

Informations de version

  • Version officielle de FLUX-Text :Ouvrez la démo Gradio et les poids pré-entraînés, et prenez en charge l'édition de texte de scène multilingue.
  • première version de recherche :Publiez l'article arXiv et le code de raisonnement initial pour vérifier la faisabilité de l'édition du texte de la scène.

Avis des utilisateurs

  • Chargement des avis...