Alibaba Open Source Qwen-Image: 20B-Parameter, wodurch „Text-Rendering“ zur Heimat von Bildmodellen wird
Alibaba Tongyi Qianwen veröffentlichte am 4. August 2025 Qwen-Image, ein 20B-Parameter-MMDiT-Bildbasismodell, das Durchbrüche bei der komplexen Textwiedergabe (mehrzeiliger Schriftsatz, Absatzsemantik, feinkörnige Details) erzielt hat, mehrere Sprachen wie Chinesisch und Englisch unterstützt und Open Source auf GitHub, Hugging Face und ModelScope ist.
Die meisten Bilderzeugungsmodelle arbeiten hart daran, „gutes Aussehen zu zeichnen“, scheitern aber oft daran, „gute Zeichen zu schreiben“ – chinesische Schriftzeichen auf Postern haben immer nur wenige Striche und nur wenige Striche. Qwen-Image, veröffentlicht von Alibaba Tongyi Qianwen am 4. August 2025, hat sich entschieden, den schmerzhaftesten Punkt dieser chinesischen Szene direkt anzugehen: ein MMDiT-Bildbasismodell (Multi-modal Diffusion Transformer) mit 20B Parametern, das komplexe Textwiedergabe zu seiner Hauptfunktion macht.
Konzentrieren Sie sich auf „textintensive“ Bilder
Die Hauptfunktionen von Qwen-Image sind sehr fokussiert: mehrzeiliger Schriftsatz, Semantik auf Absatzebene, feinkörnige Details und andere komplexe Textwiedergabefunktionen, während gleichzeitig mehrere alphabetische/ideografische Sprachen wie Chinesisch und Englisch unterstützt werden. Dies bedeutet, dass starke Textszenen, in denen „Text das Thema ist“, wie Poster, Logos und Werbung, endlich ein Open-Source-Modell haben, das für Chinesisch geeignet ist. Neben der Textwiedergabe unterstützt es auch die präzise Bearbeitung als Bildbasismodell.
Benutzer können im Qwen Chat „Bildgenerierung“ auswählen, um es direkt zu erleben, und das Modell wird auch als Open Source auf GitHub, Hugging Face, ModelScope und anderen Plattformen veröffentlicht – inländische Entwickler können es herunterladen und verwenden, ohne die Firewall umgehen zu müssen, was für die Umsetzung von Projekten in der chinesischen Community eine echte Erleichterung darstellt.
Ein nachhaltiger Open-Source-Kampf
Qwen-Image ist keine isolierte Aktion. Fünfzehn Tage später (19. August) veröffentlichte das Team Qwen-Image-Edit – basierend auf derselben 20B-Basis, um die Textwiedergabefunktionen auf Bearbeitungsaufgaben zu erweitern. Diese „Generierung + Bearbeitung“-Dual-Engine konkurriert direkt mit internationalen Modellen wie DALL·E, Stable Diffusion und Flux und macht Qwen auch zu Alibabas repräsentativster Open-Source-Errungenschaft in Richtung multimodaler Generierung.
Aus Branchensicht ist die differenzierte Strategie von Qwen-Image ziemlich klug: Sie vermeidet den positiven Konsum von „Fotografie/künstlerischem Stil“ bei ausländischen Models und konzentriert sich stattdessen auf die „Wiedergabe chinesischer Texte“, ein Bereich, in dem ausländische Models im Allgemeinen schwach sind, aber in der heimischen Design-, E-Commerce- und Werbebranche häufig benötigt werden. Für inländische Bild-Tool-Entwickler bietet es eine kommerziell verfügbare und fein abgestimmte chinesische Basis – diese Kombination aus „Open Source + chinesischer Szenenanpassung“ ist genau das, was Chinas Open-Source-Ökosystem am meisten braucht.
Mehrere Richtungen, die es wert sind, in Zukunft verfolgt zu werden:
- Qwen-Images Community-Ökologie: die Anzahl der darauf basierenden vertikalen Modelle (E-Commerce, Werbung, UI).
- Die Grenzen der chinesischen Langtextwiedergabe: Ob die Stabilität ultralanger Absätze und dichter kleiner Zeichen dem Produktionstest standhalten kann.
- Open-Source-Vergleich mit Flux/SD3.5: Wie man das Dilemma zwischen Textwiedergabe und Bildqualität unter derselben Parameterskala abwägt.
- Alibabas multimodale Folgemaßnahmen: Ob sich Qwen-Image zu einem Teil der Videogenerierungsbasis entwickeln wird.
Bewertungen