Alibaba open source Qwen-Image : 20 B de paramètres, faisant du "rendu de texte" la maison des modèles d'image
Alibaba Tongyi Qianwen a publié Qwen-Image le 4 août 2025, un modèle de base d'image MMDiT à 20 B paramètres, qui a fait des percées dans le rendu de texte complexe (composition multiligne, sémantique des paragraphes, détails fins), prend en charge plusieurs langues telles que le chinois et l'anglais, et est open source sur GitHub, Hugging Face et ModelScope.
La plupart des modèles de génération d'images travaillent dur pour « dessiner joliment », mais échouent souvent dans « l'écriture de bons caractères » - les caractères chinois sur les affiches sont toujours à court de traits et peu de traits. Qwen-Image, publié par Alibaba Tongyi Qianwen le 4 août 2025, a choisi de s'attaquer de front au point le plus douloureux de cette scène chinoise : un modèle de base d'image MMDiT (Multi-modal Diffusion Transformer) avec 20B de paramètres, faisant du rendu de texte complexe sa capacité d'origine.
Focus sur les images "à forte teneur en texte"
Les fonctionnalités clés de Qwen-Image sont très ciblées : composition multiligne, sémantique au niveau des paragraphes, détails fins et autres capacités de rendu de texte complexes, tout en prenant en charge plusieurs langues alphabétiques/idéographiques telles que le chinois et l'anglais. Cela signifie que les scènes de texte fortes où « le texte est le sujet », comme les affiches, les logos et les publicités, ont enfin un modèle sous-jacent open source et adapté au chinois. En plus du rendu de texte, il prend également en charge une édition précise en tant que modèle de base d'image.
Les utilisateurs peuvent sélectionner « Génération d'images » dans Qwen Chat pour en faire l'expérience directement, et le modèle est également publié en open source sur GitHub, Hugging Face, ModelScope et d'autres plateformes - les développeurs nationaux peuvent le télécharger et l'utiliser sans avoir à contourner le pare-feu, ce qui est une réelle commodité pour la mise en œuvre de projets dans la communauté chinoise.
Une bataille open source durable
Qwen-Image n'est pas une action isolée. Quinze jours plus tard (19 août), l'équipe a publié Qwen-Image-Edit, basé sur la même base 20B, pour étendre les capacités de rendu de texte aux tâches d'édition. Ce double moteur « génération + édition » concurrence directement les modèles internationaux tels que DALL·E, Stable Diffusion et Flux, et constitue également Qwen la réalisation open source la plus représentative d'Alibaba en matière de génération multimodale.
D'un point de vue industriel, la stratégie différenciée de Qwen-Image est assez intelligente : elle évite la consommation positive de « photographie/style artistique » avec des modèles étrangers, et se concentre plutôt sur le « rendu de texte chinois », un domaine dans lequel les modèles étrangers sont généralement faibles mais sont fréquemment nécessaires dans les secteurs nationaux du design, du commerce électronique et de la publicité. Pour les développeurs nationaux d'outils d'image, il fournit une base chinoise disponible dans le commerce et affinée - cette combinaison « open source + adaptation de la scène chinoise » est exactement ce dont l'écosystème open source chinois a le plus besoin.
Plusieurs orientations à suivre dans le futur :
- L'écologie communautaire de Qwen-Image : le nombre de modèles verticaux (e-commerce, publicité, UI) affinés en fonction de celle-ci.
- La limite du rendu des textes longs chinois : si la stabilité des paragraphes ultra-longs et des petits caractères denses peut résister aux tests de production.
- Comparaison open source avec Flux/SD3.5 : Comment peser le dilemme entre le rendu du texte et la qualité de l'image sous la même échelle de paramètres.
- Actions de suivi multimodales d'Alibaba : Qwen-Image évoluera-t-il pour devenir une partie de la base de génération vidéo.
Avis