Qwen-Image-Edit open source : architecture de contrôle à double canal, pour que "changer les mots dans l'image" ne nécessite plus de retouche
Alibaba Tongyi Qianwen a publié Qwen-Image-Edit le 19 août 2025. Il est construit sur la base de 20B Qwen-Image. Grâce à l'architecture double canal de Qwen2.5-VL (contrôle sémantique visuel) + encodeur VAE (contrôle d'apparence visuelle), il réalise à la fois « l'édition sémantique + l'édition d'apparence » et prend en charge l'édition précise du texte dans les images.
Le lien le plus fastidieux dans le flux de travail de conception n'est souvent pas « dessiner une image » mais « corriger une faute de frappe » : un texte incorrect dans une image promotionnelle générée par l'IA signifie généralement redessiner l'image entière. Qwen-Image-Edit, publié par Alibaba Tongyi Qianwen le 19 août, tente de mettre un terme à cette refonte : la base Qwen-Image basée sur des paramètres 20B étend les capacités de rendu de texte aux tâches d'édition et prend en charge le remplacement et la correction précis du texte.
Contrôle bidirectionnel : la sémantique et l'apparence remplissent chacune leurs propres tâches
La technologie de base de Qwen-Image-Edit est un ensemble d'architectures à double entrée : la même image d'entrée est introduite dans deux canaux en même temps——
- Qwen2.5-VL : responsable du contrôle sémantique visuel, de la compréhension des instructions et des modifications au niveau sémantique
- Encodeur VAE : responsable du contrôle de l'apparence visuelle, en conservant le style, la composition et d'autres informations d'apparence de l'image originale
Les deux canaux fonctionnent en parallèle pour réaliser à la fois « l'édition sémantique + l'édition d'apparence » - il peut comprendre des instructions telles que « changer « automne » dans l'affiche en « hiver » » sans s'écarter du style de mise en page de l'image entière. Cette architecture est la clé pour trouver un équilibre entre qualité d’édition et efficacité.
Formez un double moteur avec Qwen-Image
Qwen-Image-Edit et Qwen-Image constituent ensemble les deux moteurs open source de Tongyi Qianwen dans le sens de la génération/édition d’images. Le modèle est également open source sur GitHub, Hugging Face et ModelScope et est connecté à Qwen Chat. Pour des secteurs tels que le design, le commerce électronique et la publicité, cela réduit considérablement le coût des tâches de « retouche d'images à forte intensité de texte » dans les scénarios chinois, en particulier les opérations à haute fréquence telles que la modification de mots et la rédaction, qui peuvent être résolues directement au niveau de la couche modèle.
Du point de vue de l'industrie, Qwen Le style de jeu de cette combinaison poursuit la stratégie chinoise axée sur la scène : les modèles d'édition à l'étranger souffrent naturellement de la compréhension des instructions chinoises et de la conservation des glyphes chinois, tandis que la série Qwen (y compris la compréhension sémantique visuelle 2,5-VL) a un avantage sur le terrain sur cette piste. Pour les outils d'image nationaux et les plateformes de commerce électronique, un modèle open source qui « peut comprendre les instructions chinoises de modification d'image » constitue une base prête à l'emploi pour intégrer les capacités d'édition de l'IA dans les processus commerciaux.
Plusieurs orientations à suivre dans le futur :
- Stabilité dans les mises en page complexes : Le taux de réussite de l'édition d'affiches multitextes et multicouches est la clé des applications de niveau production.
- Granularité de l'édition : Est-il possible de "changer un mot mais pas les autres", ou est-il toujours possible d'en redessiner des parties ?
- Intégration avec les outils de conception (Photoshop/instant design) : Modèle Open source + rapidité d'implémentation sous forme de plug-in.
- La mise à niveau Qwen2.5-VL augmente les capacités d'édition : Plus la compréhension sémantique visuelle est forte, plus les instructions d'édition suivantes sont précises.
Avis