Peintre de cadres
Gratuit
FramePainter est un outil d'édition d'images open source inclus dans ICCV 2025. Il utilise la diffusion vidéo préalable (Stable Video Diffusion) pour mettre en œuvre une édition d'images interactive basée sur des croquis. Les utilisateurs n'ont qu'à dessiner des croquis sur l'image, et l'IA peut comprendre l'intention d'édition et générer des effets de niveau professionnel, fonctionnant bien dans les scénarios d'édition courants et les scénarios de généralisation hors domaine.
FramePainter
Paramètres et statistiques de base
| Projet | Spécifications |
|---|---|
| Nom du produit | Peintre de cadres |
| Catégorie | Conception visuelle IA / Édition d'images |
| Formulaire de livraison | Outil de bureau (Python/PyTorch) |
| Plateforme d'assistance | Bureau |
| Langues prises en charge | zh-CN, en-US |
| Utilisateurs cibles | Chercheurs, concepteurs, créateurs en IA |
| Échelle utilisateur | GitHub 406 étoiles (projet académique) |
| Modèle de tarification | Gratuit (MIT Open Source) |
Les données sur la couverture de la plate-forme et l'échelle des utilisateurs sont basées sur la page officielle en temps réel et sur des statistiques tierces.
Reconnaissance des utilisateurs et du marché
L'article FramePainter a été accepté par l'ICCV 2025 et a obtenu des résultats SOTA de premier plan dans le domaine de l'édition d'images interactives. Par rapport aux méthodes précédentes, FramePainter offre une meilleure qualité d'édition et des capacités de généralisation avec beaucoup moins de données de formation. 406 étoiles sur GitHub, HuggingFace fournit des poids complets pré-entraînés. Il est inclus dans de nombreux sites d'agrégation d'outils d'IA tels que Art Weekly et KDJingpai. L'idée technique proposée de « reconstruire l'édition d'images en génération d'image en vidéo » fournit une nouvelle référence paradigmatique pour les recherches ultérieures sur l'édition interactive.
Avantage de coût
| Dimension du coût | Descriptif |
|---|---|
| Licences de logiciels | MIT open source, entièrement gratuit |
| Poids pré-entraînés | Téléchargement gratuit depuis HuggingFace |
| Utilisation commerciale | Licence MIT, utilisation commerciale autorisée |
| Coût du matériel | Besoin d'apporter votre propre GPU NVIDIA (mémoire vidéo recommandée ≥ 8 Go) |
L'article souligne qu'en raison de l'utilisation préalable de la diffusion vidéo de Stable Video Diffusion, le volume de données de formation et le coût de calcul sont bien inférieurs à ceux des méthodes précédentes basées sur des modèles de diffusion texte-image.
Fonctions principales
- Édition basée sur un croquis : l'utilisateur dessine un croquis sur l'image pour spécifier l'intention d'édition, et l'IA comprend automatiquement la sémantique du croquis et génère une image conforme aux instructions. L'épaisseur, la position et la forme de l'esquisse affectent directement les résultats de l'édition sans qu'un masquage précis soit nécessaire.
- Édition basée sur les clics : spécifiez la zone d'édition et la cible via des opérations de clic, adaptées à l'ajustement rapide du contenu local de l'image.
- Édition par glisser : faites glisser les points clés de l'image pour contrôler les changements de posture, de forme ou de position de l'objet. Grâce à la diffusion vidéo, vous pouvez comprendre a priori les règles du mouvement et rendre la déformation plus naturelle.
- Édition généralisée hors domaine : point fort - En utilisant la diffusion vidéo préalable, des résultats raisonnables peuvent toujours être générés dans des scénarios d'édition non couverts par les données de formation (comme la transformation d'un poisson clown en forme de requin).
- Mécanisme d'attention correspondant : élargissez le champ de réception et améliorez la correspondance dense entre l'image éditée et le jeton de l'image source, garantissant ainsi la cohérence du contenu après une édition substantielle.
Evolution du modèle et de la version
| Version | Dates | Changements clés |
|---|---|---|
| v1.0 (ICCV 2025) | ~2025-01 | Démo complète d'inférence, poids HuggingFace, prend en charge tous les modes d'édition |
| arXivv1 | 2025-01-14 | Le document a été publié pour la première fois (2501.08225) et la solution technique a été rendue publique |
Avantages techniques
- Paradigme de reconstruction de problèmes : redéfinissez l'édition d'images interactives en tant que problème de « génération d'image en vidéo ». En héritant de la diffusion vidéo antérieure à la diffusion vidéo stable, vous pouvez naturellement comprendre les lois changeantes du mouvement des objets et réduire considérablement les coûts de formation.
- Encodeur léger Sparse Control : seul un encodeur léger est introduit pour injecter des signaux d'édition, la quantité de nouveaux paramètres est minime et la formation et l'inférence sont très efficaces.
- Matching Attention : élargissez la plage de recherche d'attention croisée, établissez une correspondance dense point par point et maintenez la cohérence du contenu même si la posture ou la forme est considérablement modifiée.
- Unification du signal d'édition multimodale : la même architecture prend en charge plusieurs méthodes d'interaction telles que l'esquisse, le clic, le glisser, etc., sans qu'il soit nécessaire d'entraîner différents modèles séparément.
Comment utiliser
| Entrée | Installation/Utilisation |
|---|---|
| Code source de GitHub | git clone → conda create → pip install → télécharger le poids → python app.py |
Téléchargez les poids pré-entraînés depuis HuggingFace (Yabo/FramePainter) dans le répertoire checkpoints/. Pendant l'inférence, Stabilityai/stable-video-diffusion-img2vid-xt-1-1 est automatiquement téléchargé en tant que modèle de base.
Prix des produits
| Projet | Coût |
|---|---|
| Licences de logiciels | Gratuit (Licence MIT) |
| Poids pré-entraînés | Gratuit (HuggingFace) |
| Utilisation commerciale | Autorisé (licence MIT) |
| Service cloud | Pas de service cloud officiel, vous devez le déployer localement |
Scénarios d'application
- Conception d'images interactives et édition créative : les concepteurs utilisent des croquis pour ajuster rapidement la composition des images, remplacer des objets et modifier les styles, éliminant ainsi les opérations complexes de masquage et de calque dans les logiciels traditionnels.
- Production de matériel visuel publicitaire et marketing : L'équipe marketing génère rapidement plusieurs versions de matériel publicitaire par glisser-déposer et par croquis, raccourcissant ainsi le processus de l'exigence au dessin à quelques minutes.
- post-production et conception de concepts cinématographiques et télévisuels : la capacité de généralisation en dehors du domaine lui permet de jouer un rôle dans des scénarios créatifs non couverts par les données de formation, ce qui le rend adapté aux storyboards de films et à la conception de concepts de jeux.
Personnes concernées
- Utilisateurs individuels : chercheurs et développeurs en IA, fournissant une formation complète et des codes d'inférence, adaptés comme système de base pour la recherche interactive sur l'édition d'images.
- Équipe PME : les concepteurs et les créatifs doivent itérer rapidement sur des solutions visuelles.
- Grandes entreprises : ne convient pas - projets purement académiques, sans polissage UI/UX de qualité commerciale et sans support de service client.
- Unfit Boundary : environnements de production qui nécessitent un contrôle précis au niveau des pixels (tels que la finition de l'impression) ; scénarios de traitement par lots qui nécessitent des performances élevées en temps réel ; utilisateurs sans GPU NVIDIA.
Comparaison des produits concurrents
| Comparer les dimensions | Peintre de cadres | ContrôleNet | DragGAN |
|---|---|---|---|
| Différences fondamentales | Diffusion vidéo préalable, généralisation hors domaine | Génération de contrôle conditionnel | Édition par glisser-déposer |
| Prix | Gratuit (MIT Open Source) | Gratuit (Open Source) | Gratuit (Open Source) |
| Scène de couverture | Édition interactive, conception créative | Génération conditionnelle | Édition de posture |
| Évaluation des utilisateurs | Forte capacité de généralisation | Contrôle précis | Interaction intuitive |
| Seuil technique | Moyen (nécessite GPU + installation) | Moyen (nécessite un GPU) | Moyen (nécessite un GPU) |
Résumé et Outlook
FramePainter s'appuie sur l'innovation paradigmatique consistant à « reconstruire l'édition d'images en génération d'image en vidéo » et utilise les priorités de diffusion vidéo pour réduire considérablement le coût de formation à l'édition d'images interactive. La capacité de généralisation en dehors du domaine est son point fort.
Évaluation des risques d'approvisionnement/d'adoption : FramePainter est un projet de recherche purement académique sans équipe de commercialisation ni support au niveau de l'entreprise. Les mises à jour et la maintenance du code dépendent du temps personnel de l'auteur original et il n'y a aucun engagement SLA. Il est recommandé d'évaluer les risques d'utilisation dans des projets de production, ou d'attendre qu'un tiers le conditionne dans un produit/service commercialisable. |---|---| | Type de produit | Outil d'édition d'images interactif basé sur des croquis (projet universitaire open source) | | Prise en charge de la plateforme | Bureau (Python/PyTorch) | | Heure de publication papier | Janvier 2025 (arXiv), inclus dans ICCV 2025 | | Version actuelle | 1.0 (version correspondante ICCV 2025) | | Modèle de base | Diffusion vidéo stable (SVD) | | Architecture de base | Encodeur de contrôle clairsemé + Attention correspondante | | Méthode de saisie | Image + Croquis | | Modifier les signaux | Dessiner, cliquer, faire glisser et autres opérations visuelles interactives | | Licence | Licence MIT | | Étoiles GitHub | 406 (en juillet 2026) | | CâlinsPoids du visage | Yabo/FramePainter |
FramePainter est la mise en œuvre officielle des articles inclus dans l'ICCV 2025 proposé conjointement par le Harbin Institute of Technology (HIT) et le Noah's Ark Laboratory de Huawei. Il ne s'agit pas d'un produit SaaS commercial, mais d'un projet de recherche universitaire open source - redéfinissant l'édition d'images interactive comme un problème de « génération d'image en vidéo », héritant ainsi des puissantes capacités temporelles antérieures du modèle de diffusion vidéo. L’idée principale est que les données vidéo contiennent naturellement le processus changeant des objets lors d’une interaction physique. La modélisation de l'édition d'images sous forme de « génération de pseudo-vidéo » entre deux images peut réduire considérablement les coûts de formation et garantir la cohérence temporelle.
Reconnaissance des utilisateurs et du marché
FramePainter a suscité une grande attention dans la communauté universitaire et dans le domaine de l'édition d'images IA :
- Reconnaissance académique : l'article a été accepté par l'ICCV 2025 et a obtenu des résultats SOTA de premier plan dans le sens de l'édition d'images interactives. Par rapport aux méthodes précédentes, FramePainter offre une meilleure qualité d'édition et des capacités de généralisation avec beaucoup moins de données de formation.
- Communauté Open Source : GitHub a reçu 406 étoiles (en juillet 2026), des poids pré-entraînés complets sont fournis sur HuggingFace et les développeurs de la communauté peuvent télécharger et déployer librement.
- Couverture médiatique : incluse et rapportée par plusieurs sites d'agrégation d'outils d'IA tels que Art Weekly et KDJingpai.
- Influence technique : L'idée technique proposée de « reconstruire l'édition d'images en génération d'image en vidéo » fournit une nouvelle référence paradigmatique pour les recherches ultérieures sur l'édition interactive.
Avantage de coût
FramePainter est un projet entièrement open source (licence MIT) avec un coût d'utilisation nul.
- Coût du logiciel : aucun frais d'abonnement ou de licence requis. Le code est librement cloné depuis GitHub et les poids pré-entraînés sont librement téléchargés depuis HuggingFace.
- Coût matériel : un ordinateur équipé d'un GPU NVIDIA (mémoire vidéo recommandée ≥ 8 Go) est requis pour exécuter l'inférence. Comparé aux outils commerciaux d’édition d’images payants des services cloud, le coût marginal du déploiement local approche zéro en cas d’utilisation intensive.
- Coût de formation : l'article souligne qu'en raison de l'utilisation préalable de la diffusion vidéo de Stable Video Diffusion, le volume de données de formation et le coût de calcul de FramePainter sont bien inférieurs aux méthodes précédentes basées sur des modèles de diffusion texte-image - c'est la source de son principal avantage en termes de coût.
Fonctions principales
- Édition basée sur un croquis : l'utilisateur dessine un croquis sur l'image pour spécifier l'intention d'édition (comme changer la forme de l'objet, ajuster la posture, remplacer le contenu local), et FramePainter comprend automatiquement la sémantique du croquis et génère une image conforme aux instructions d'édition. L'épaisseur, la position et la forme de l'esquisse affectent directement les résultats de l'édition, et l'interaction est intuitive et ne nécessite pas de masquage précis.
- Édition basée sur le clic : prend en charge la spécification de la zone d'édition et de la cible via des opérations de clic, permettant d'ajuster rapidement le contenu local de l'image. Les opérations pointer-cliquer sont plus rapides que l'esquisse et conviennent aux tâches simples de remplacement et de réparation.
- Édition par glisser : les utilisateurs font glisser des points clés dans l'image pour contrôler les changements de posture, de forme ou de position de l'objet. Différent du montage glisser-déposer basé sur le flux optique, FramePainter comprend a priori les schémas de mouvement des objets grâce à la diffusion vidéo, et la déformation générée est plus naturelle.
- Généralisation hors domaine : il s'agit du point fort de FramePainter : en utilisant la diffusion vidéo au préalable, le modèle peut toujours générer des résultats raisonnables dans des scénarios d'édition qui ne sont pas apparus dans les données d'entraînement. Par exemple, transformer un poisson-clown en forme de requin, ajouter des effets de lumière réfléchissants qui n'existaient pas à l'origine à une tasse, etc. démontrent une créativité qui dépasse les limites du montage conventionnel.
- Matching Attention : Compte tenu des limites de l'attention temporelle dans le traitement des mouvements importants, une couche d'attention correspondante est proposée pour élargir le champ de réception et améliorer la correspondance dense entre l'image éditée et le jeton de l'image source, assurant la cohérence des résultats d'édition dans le contenu et la structure.
Evolution du modèle et de la version
| Version | Temps | Changements fondamentaux |
|---|---|---|
| arXivv1 | 2025-01-14 | Le document a été publié pour la première fois (2501.08225), rendant public le plan technique, les résultats expérimentaux et une partie du code |
| v1.0 (ICCV 2025) | ~2025-01 | Démo complète d'inférence publiée, poids pré-entraînés téléchargés sur HuggingFace, prenant en charge le processus d'édition complet |
Après que l'article ait été rendu public pour la première fois en janvier 2025, le code d'inférence complet et les poids de pré-entraînement ont été publiés le même mois. Aucune nouvelle version de code ne sera publiée après l'acceptation officielle de l'ICCV 2025. L'entrepôt actuel est la version stable officiellement mise en œuvre par le journal.
Avantages techniques
- Paradigme de reconstruction de problèmes : la principale innovation technique de FramePainter est de redéfinir l'édition d'images interactives comme un problème de « génération d'image en vidéo ». Les méthodes traditionnelles considèrent l'édition comme une tâche de génération d'images conditionnelles, qui nécessite une grande quantité de données d'entraînement appariées et des encodeurs de référence supplémentaires pour apprendre la dynamique physique ; FramePainter, en héritant de la diffusion vidéo existante avant Stable Video Diffusion, comprend naturellement les modèles changeants des objets en mouvement, réduisant ainsi considérablement les coûts de formation et la dépendance à l'égard de la quantité de données appariées.
- Encodeur de contrôle léger et clairsemé : introduisez uniquement un encodeur de contrôle léger et clairsemé pour injecter des signaux d'édition (esquisse, clic, glisser, etc.) au lieu de dupliquer l'intégralité de l'encodeur U-Net comme ControlNet. Cela permet au modèle de conserver les capacités de base de SVD tout en ajoutant un minimum de nouveaux paramètres et en rendant la formation et l'inférence plus efficaces.
- Matching Attention : Le mécanisme d'attention temporelle standard a un champ de réception limité lorsqu'il s'agit de mouvements importants entre deux images, ce qui peut facilement conduire à une édition incohérente. L'attention correspondante établit des correspondances denses point par point entre les images éditées et les jetons d'image source en élargissant la portée de la recherche en attention croisée, en maintenant la cohérence du contenu même lorsque les poses ou les formes des objets sont radicalement modifiées.
- Unification des signaux d'édition multimodaux : la même architecture prend en charge plusieurs méthodes d'interaction telles que l'esquisse, le clic et le glissement en même temps, éliminant ainsi le besoin de former différents modèles pour différents signaux d'interaction. Ce cadre unifié permet de combiner différentes méthodes d'édition (comme dessiner d'abord le contour puis faire glisser pour ajuster la position).
- Capacité de généralisation hors domaine : grâce aux riches connaissances du monde physique contenues dans la diffusion vidéo préalable, FramePainter peut toujours générer des résultats visuellement raisonnables dans des scénarios d'édition non couverts par les données de formation (comme la transformation de poissons en forme de requin), ce qui était auparavant difficile à obtenir avec des modèles de diffusion d'image pure.
Comment utiliser
FramePainter est un projet open source qui s'exécute localement et ne nécessite aucune inscription de compte ni abonnement payant.
Préparation
# Cloner le dépôt
clone git https://github.com/YBYBZhang/FramePainter.git
cd FramePainter
#Créer un contexte Conda
conda create -n framepainter python=3.10
conda activer framepainter
# Installer les dépendances
pip install -r exigences.txt
Télécharger le poids
Téléchargez les poids pré-entraînés depuis HuggingFace et placez-les dans le répertoire checkpoints/. Pendant l'inférence, app.py téléchargera automatiquement stabilityai/stable-video-diffusion-img2vid-xt-1-1 comme modèle de base.
Exécuter l'inférence
pythonapp.py
Après le démarrage, vous pouvez télécharger des images, dessiner des croquis et prévisualiser les effets d'édition en temps réel dans l'interface interactive. Pour des instructions détaillées, veuillez vous référer au fichier README de l'entrepôt GitHub et au texte original du document.
Prix des produits
FramePainter est entièrement open source (licence MIT), sans aucun paiement.
| Projet | Coût |
|---|---|
| Licence de logiciel | Gratuit (MIT Open Source) |
| Poids pré-entraînés | Gratuit (téléchargement HuggingFace) |
| Utilisation commerciale | Autorisé (licence MIT) |
| Abonnement/Service Cloud | Pas de service cloud officiel, besoin de le déployer localement |
En termes de matériel, vous devez apporter votre propre GPU NVIDIA. Si vous souhaitez en faire l'expérience en ligne, vous pouvez prêter attention à la démo tierce déployée par la communauté (maintenance non officielle).
Scénarios d'application
- Conception d'images interactives et édition créative : les concepteurs utilisent des croquis pour ajuster rapidement la composition des images, remplacer des objets et modifier les styles. L'interaction intuitive des croquis de FramePainter élimine le masquage complexe et la manipulation des calques que l'on trouve dans les logiciels traditionnels, rendant ainsi l'itération créative plus efficace. Le mécanisme d'attention correspondante garantit que le contenu de l'image reste cohérent même après une édition approfondie.
- Production de matériel visuel de publicité et de marketing : l'équipe marketing génère rapidement plusieurs versions de matériel publicitaire par glisser-déposer (comme le remplacement de l'emballage du produit, l'ajustement des postures des modèles, le changement d'arrière-plan). Puisqu'il n'y a pas besoin de données de formation, vous pouvez opérer directement sur la carte terminée, et le temps entre la demande et la production de la carte est réduit à quelques minutes.
- Posproduction cinématographique et télévisuelle et conception conceptuelle : le personnel de postproduction cinématographique et télévisuelle génère rapidement des aperçus des effets d'objectif pendant la phase de conception conceptuelle. La capacité de généralisation hors domaine de FramePainter lui permet de jouer un rôle dans des scénarios créatifs non couverts par les données de formation (comme l'ajout d'éléments non réalistes à des scènes historiques), ce qui le rend adapté aux storyboards de films et à la conception de concepts de jeux.
- Recherche universitaire et validation d'algorithmes : en tant qu'implémentation open source officielle de l'article ICCV 2025, FramePainter fournit aux chercheurs en vision par ordinateur un système de base d'édition interactif directement exécutable. Des recherches ultérieures peuvent permettre de réaliser des améliorations et des expériences comparatives sur cette base.
Personnes concernées
- Chercheurs et développeurs en édition d'images IA : FramePainter fournit une formation complète et un code d'inférence et convient comme système de base pour la recherche en édition d'images interactive. La conception de la méthode et les expériences d’ablation présentées dans le document fournissent une référence claire pour les améliorations ultérieures.
- Concepteurs professionnels et créateurs : concepteurs qui ont besoin d'itérer rapidement sur des solutions visuelles sans être trop exigeants en matière de précision d'édition. Les interactions d'esquisse et de glissement sont plus rapides et plus directes que les opérations de masquage précises des outils traditionnels, ce qui les rend adaptées à l'exploration de concepts au stade de la création.
- Passionnés de peinture et de technologie IA : passionnés d'IA qui souhaitent comprendre et utiliser les derniers résultats des articles ICCV. Le processus de déploiement local est clair (Conda + pip + téléchargement de poids) et vous pouvez découvrir l'effet d'édition interactif SOTA avec un GPU NVIDIA.
- Ne convient pas au grand public : les situations de production qui nécessitent un contrôle précis au niveau des pixels (comme la finition de l'impression) ne conviennent pas à l'utilisation d'outils d'édition basés sur le modèle de diffusion ; les scénarios qui ont des exigences strictes en temps réel (tels que les pipelines de traitement automatisé par lots) doivent prendre en compte l'inférence chronophage ; les utilisateurs sans matériel GPU NVIDIA ne peuvent pas l'exécuter localement. De plus, en tant que projet de recherche, FramePainter ne propose pas de finition UI/UX ni de support client de niveau commercial.
Résumé et Outlook
Avec comme noyau l'innovation paradigmatique consistant à « reconstruire l'édition d'images en génération d'image en vidéo », FramePainter exploite la diffusion vidéo de Stable Video Diffusion avant de réduire considérablement le coût de formation de l'édition d'images interactive et obtient des effets d'édition multimodaux de haute qualité grâce à des encodeurs de contrôle clairsemés et des mécanismes d'attention correspondants. Sa capacité de généralisation hors domaine est un point fort qui la distingue des méthodes précédentes : elle peut toujours générer des résultats visuels raisonnables dans l'édition de scénarios non couverts par les données d'entraînement.
Limite non adaptée : scénarios de production nécessitant un contrôle précis au niveau des pixels, scénarios de traitement par lots avec des exigences élevées en temps réel et groupes d'utilisateurs sans GPU NVIDIA. Risque d'approvisionnement/d'adoption : FramePainter est un projet de recherche purement académique sans équipe de commercialisation ni support au niveau de l'entreprise ; Les mises à jour et la maintenance du code dépendent du temps personnel de l'auteur original et il n'y a aucun engagement SLA ; il est recommandé d'évaluer les risques d'utilisation dans les projets de production, ou d'attendre qu'un tiers le conditionne dans un produit/service commercialisable.
Outils associés : midjourney, stable-diffusion
Informations de version
- Version officielle ICCV 2025 :ICCV 2025 inclut la version correspondante du document, prend en charge l'édition d'images interactives basées sur des croquis et est basé sur la diffusion vidéo stable et un encodeur de contrôle clairsemé léger. Il n’y a pas encore de date de sortie officielle précise.
- prépublications arXiv :L'article a été publié pour la première fois sur arXiv (2501.08225), divulguant la solution technique et les résultats expérimentaux.
Avis des utilisateurs