क्वेन-इमेज-एडिट ओपन सोर्स: दोहरे चैनल नियंत्रण आर्किटेक्चर, ताकि "चित्र में शब्दों को बदलने" के लिए अब दोबारा काम करने की आवश्यकता न हो

अलीबाबा टोंगी कियानवेन ने 19 अगस्त, 2025 को क्वेन-इमेज-एडिट जारी किया। इसे 20बी क्वेन-इमेज के आधार पर बनाया गया है। Qwen2.5-VL (विजुअल सिमेंटिक कंट्रोल) + VAE एनकोडर (विजुअल अपीयरेंस कंट्रोल) के दोहरे चैनल आर्किटेक्चर के माध्यम से, यह "सिमेंटिक एडिटिंग + अपीयरेंस एडिटिंग" दोनों को प्राप्त करता है और चित्रों में सटीक टेक्स्ट एडिटिंग का समर्थन करता है।

डिज़ाइन वर्कफ़्लो में सबसे कठिन लिंक अक्सर "चित्र बनाना" नहीं बल्कि "टाइपो को ठीक करना" होता है - एआई-जनित प्रचार चित्र में गलत टेक्स्ट का मतलब आमतौर पर पूरी तस्वीर को फिर से बनाना होता है। 19 अगस्त को अलीबाबा टोंगयी कियानवेन द्वारा जारी क्वेन-इमेज-एडिट, इस पुनर्कार्य को समाप्त करने का प्रयास करता है: 20बी मापदंडों पर आधारित क्वेन-इमेज बेस संपादन कार्यों में टेक्स्ट रेंडरिंग क्षमताओं का विस्तार करता है और सटीक टेक्स्ट प्रतिस्थापन और सुधार का समर्थन करता है।

दोहरे तरीके से नियंत्रण: शब्दार्थ और उपस्थिति प्रत्येक अपने-अपने कर्तव्य निभाते हैं

क्वेन-इमेज-एडिट की मुख्य तकनीक दोहरी इनपुट आर्किटेक्चर का एक सेट है: एक ही इनपुट छवि को एक ही समय में दो चैनलों में फीड किया जाता है——

  • Qwen2.5-VL: विजुअल सिमेंटिक नियंत्रण, निर्देशों को समझने और सिमेंटिक-स्तरीय संशोधन करने के लिए जिम्मेदार
  • वीएई एनकोडर: दृश्य उपस्थिति नियंत्रण के लिए जिम्मेदार, मूल छवि की शैली, संरचना और अन्य उपस्थिति जानकारी को बनाए रखना

दोनों चैनल "सिमेंटिक एडिटिंग + अपीयरेंस एडिटिंग" दोनों को प्राप्त करने के लिए समानांतर में चलते हैं - यह पूरे चित्र की लेआउट शैली से विचलित हुए बिना "पोस्टर में 'शरद ऋतु' को 'विंटर' में बदलें" जैसे निर्देशों को समझ सकता है। यह आर्किटेक्चर संपादन गुणवत्ता और दक्षता के बीच संतुलन बनाने की कुंजी है।

क्वेन-इमेज के साथ एक डुअल इंजन बनाएं

क्वेन-इमेज-एडिट और क्वेन-इमेज मिलकर छवि निर्माण/संपादन की दिशा में टोंगी कियानवेन के ओपन सोर्स दोहरे इंजन का निर्माण करते हैं। मॉडल गिटहब, हगिंग फेस और मॉडलस्कोप पर भी खुला स्रोत है और क्वेन चैट से जुड़ा है। डिज़ाइन, ई-कॉमर्स और विज्ञापन जैसे उद्योगों के लिए, यह चीनी परिदृश्यों में "पाठ-गहन छवि संपादन" कार्यों की लागत को काफी कम कर देता है - विशेष रूप से शब्द संशोधन और कॉपी राइटिंग जैसे उच्च-आवृत्ति संचालन, जिन्हें सीधे मॉडल परत पर हल किया जा सकता है।

उद्योग के दृष्टिकोण से, इस संयोजन की खेल शैली चीनी दृश्य-प्रथम रणनीति को जारी रखती है: विदेशी संपादन मॉडल स्वाभाविक रूप से चीनी निर्देशों को समझने और चीनी ग्लिफ़ को बनाए रखने से पीड़ित होते हैं, जबकि क्वेन श्रृंखला (2.5-वीएल दृश्य अर्थ समझ सहित) को इस ट्रैक पर घरेलू क्षेत्र में लाभ मिलता है। घरेलू छवि उपकरण और ई-कॉमर्स प्लेटफार्मों के लिए, एक खुला स्रोत मॉडल जो "चीनी छवि संशोधन निर्देशों को समझ सकता है" व्यावसायिक प्रक्रियाओं में एआई संपादन क्षमताओं को एम्बेड करने के लिए एक तैयार आधार है।

भविष्य में ट्रैकिंग के लायक कई दिशाएँ:

  1. जटिल लेआउट में स्थिरता: मल्टी-टेक्स्ट और मल्टी-लेयर पोस्टर की संपादन सफलता दर उत्पादन-स्तरीय अनुप्रयोगों की कुंजी है।
  2. ग्रैन्युलैरिटी का संपादन: क्या "एक शब्द को बदलना संभव है लेकिन अन्य को नहीं", या क्या इसके कुछ हिस्सों को फिर से बनाना अभी भी संभव है?
  3. डिज़ाइन टूल के साथ एकीकरण (फ़ोटोशॉप/तत्काल डिज़ाइन): ओपन सोर्स मॉडल + प्लग-इन फॉर्म में कार्यान्वयन की गति।
  4. Qwen2.5-VL अपग्रेड संपादन क्षमताओं को बढ़ाता है: दृश्य अर्थ संबंधी समझ जितनी मजबूत होगी, निम्नलिखित संपादन निर्देश उतने ही सटीक होंगे।
कॉपीराइट: सामग्री स्रोत क्वेन आधिकारिक ब्लॉग । इस प्लेटफॉर्म ने सूचना प्रसार और सीखने के आदान-प्रदान के उद्देश्य से इस सामग्री को संकलित और व्यवस्थित किया है। कॉपीराइट संबंधी चिंताओं के लिए कृपया हमसे संपर्क करें।

समीक्षाएं

  • समीक्षाएं लोड हो रही हैं...