अलीबाबा ओपन सोर्स क्वेन-इमेज: 20बी पैरामीटर, जो "टेक्स्ट रेंडरिंग" को इमेज मॉडल का घर बनाता है
अलीबाबा टोंगी कियानवेन ने 4 अगस्त, 2025 को क्वेन-इमेज जारी किया, एक 20B पैरामीटर MMDiT इमेज बेसिक मॉडल, जिसने जटिल टेक्स्ट रेंडरिंग (मल्टी-लाइन टाइपसेटिंग, पैराग्राफ सिमेंटिक्स, फाइन-ग्रेन्ड डिटेल्स) में सफलता हासिल की है, चीनी और अंग्रेजी जैसी कई भाषाओं का समर्थन करता है, और GitHub, हगिंग फेस और मॉडलस्कोप पर खुला स्रोत है।
अधिकांश छवि निर्माण मॉडल "अच्छे दिखने वाले चित्र बनाने" पर कड़ी मेहनत करते हैं, लेकिन अक्सर "अच्छे अक्षर लिखने" में असफल होते हैं - पोस्टरों पर चीनी अक्षरों में हमेशा स्ट्रोक और कुछ स्ट्रोक की कमी होती है। 4 अगस्त, 2025 को अलीबाबा टोंगी कियानवेन द्वारा जारी क्वेन-इमेज ने इस चीनी दृश्य के सबसे दर्दनाक बिंदु से निपटने के लिए चुना: 20B पैरामीटर के साथ एक MMDiT (मल्टी-मोडल डिफ्यूजन ट्रांसफार्मर) इमेज बेसिक मॉडल, जो जटिल टेक्स्ट रेंडरिंग को अपनी घरेलू क्षमता बनाता है।
"पाठ-गहन" छवियों पर ध्यान दें
क्वेन-इमेज की प्रमुख विशेषताएं अत्यधिक केंद्रित हैं: मल्टी-लाइन टाइपसेटिंग, पैराग्राफ-स्तरीय शब्दार्थ, बारीक विवरण और अन्य जटिल पाठ प्रतिपादन क्षमताएं, जबकि चीनी और अंग्रेजी जैसी कई वर्णमाला/वैचारिक भाषाओं का समर्थन करती हैं। इसका मतलब यह है कि मजबूत टेक्स्ट दृश्य जहां "टेक्स्ट विषय है" जैसे कि पोस्टर, लोगो और विज्ञापन में अंततः एक खुला स्रोत, चीनी-अनुकूल अंतर्निहित मॉडल होता है। टेक्स्ट रेंडरिंग के अलावा, यह इमेज बेस मॉडल के रूप में सटीक संपादन का भी समर्थन करता है।
उपयोगकर्ता इसे सीधे अनुभव करने के लिए क्वेन चैट में "इमेज जेनरेशन" का चयन कर सकते हैं, और मॉडल को गिटहब, हगिंग फेस, मॉडलस्कोप और अन्य प्लेटफार्मों पर ओपन सोर्स के रूप में भी जारी किया गया है - घरेलू डेवलपर्स फ़ायरवॉल को दरकिनार किए बिना इसे डाउनलोड और उपयोग कर सकते हैं, जो चीनी समुदाय में परियोजनाओं के कार्यान्वयन के लिए एक वास्तविक सुविधा है।
एक स्थायी खुला स्रोत लड़ाई
क्वेन-इमेज कोई अलग कार्रवाई नहीं है। पंद्रह दिन बाद (19 अगस्त), टीम ने संपादन कार्यों के लिए टेक्स्ट रेंडरिंग क्षमताओं का विस्तार करने के लिए उसी 20बी आधार पर क्वेन-इमेज-एडिट जारी किया। यह "जनरेशन + एडिटिंग" डुअल इंजन सीधे DALL·E, स्टेबल डिफ्यूजन और फ्लक्स जैसे अंतरराष्ट्रीय मॉडलों के साथ प्रतिस्पर्धा करता है, और मल्टी-मोडल जेनरेशन की दिशा में अलीबाबा की सबसे प्रतिनिधि ओपन सोर्स उपलब्धि भी बनाता है।
उद्योग के दृष्टिकोण से, क्वेन-इमेज की विभेदित रणनीति काफी स्मार्ट है: यह विदेशी मॉडलों के साथ "फोटोग्राफी/कलात्मक शैली" की सकारात्मक खपत से बचती है, और इसके बजाय "चीनी पाठ प्रतिपादन" पर ध्यान केंद्रित करती है, एक ऐसा क्षेत्र जहां विदेशी मॉडल आम तौर पर कमजोर होते हैं लेकिन घरेलू डिजाइन, ई-कॉमर्स और विज्ञापन उद्योगों में अक्सर इसकी आवश्यकता होती है। घरेलू छवि उपकरण डेवलपर्स के लिए, यह एक चीनी आधार प्रदान करता है जो व्यावसायिक रूप से उपलब्ध है और ठीक-ठीक है - "ओपन सोर्स + चीनी दृश्य अनुकूलन" का यह संयोजन बिल्कुल वही है जिसकी चीन के ओपन सोर्स पारिस्थितिकी तंत्र को सबसे अधिक आवश्यकता है।
भविष्य में ट्रैकिंग के लायक कई दिशाएँ:
- क्वेन-इमेज की सामुदायिक पारिस्थितिकी: इसके आधार पर वर्टिकल मॉडल (ई-कॉमर्स, विज्ञापन, यूआई) की संख्या को ठीक किया गया है।
- चीनी लंबे पाठ प्रतिपादन की सीमा: क्या अल्ट्रा-लंबे पैराग्राफ और घने छोटे अक्षरों की स्थिरता उत्पादन के परीक्षण का सामना कर सकती है।
- फ्लक्स/एसडी3.5 के साथ ओपन सोर्स तुलना: एक ही पैरामीटर पैमाने के तहत टेक्स्ट रेंडरिंग और छवि गुणवत्ता के बीच दुविधा को कैसे तौला जाए।
- अलीबाबा की मल्टी-मॉडल अनुवर्ती कार्रवाइयां: क्या क्वेन-इमेज वीडियो जेनरेशन बेस के एक हिस्से के रूप में विकसित होगी।
समीक्षाएं