फ्लक्स पाठ मुफ्त

-

FLUX-Text दृश्य पाठ संपादन (दृश्य पाठ संपादन) के लिए एक खुला स्रोत प्रसार ट्रांसफार्मर मॉडल है। यह बहुभाषी पाठ संशोधन, परिवर्धन और मरम्मत का समर्थन करता है। यह पोस्टर संपादन, इमोटिकॉन उत्पादन और विज्ञापन डिजाइन जैसे छवि और पाठ प्रसंस्करण परिदृश्यों के लिए उपयुक्त है।

फ्लक्स पाठ उत्पाद इंटरफेस

फ्लक्स-पाठ

फ्लक्स-टेक्स्ट (फ्लक्स टेक्स्ट) एक बहुभाषी दृश्य टेक्स्ट संपादन मॉडल (सीन टेक्स्ट एडिटिंग, एसटीई) है जो एएमएपी मशीन लर्निंग टीम द्वारा खुला स्रोत है। यह छवियों में मौजूदा टेक्स्ट को संशोधित करने, मिटाने या नया टेक्स्ट जोड़ने पर केंद्रित है। सामान्य-उद्देश्य ग्राफिक मॉडल (जैसे कि स्टेबल डिफ्यूजन और मिडजर्नी) से अलग, फ्लक्स-टेक्स्ट की मुख्य क्षमता "छवि में पाठ सामग्री को सटीक रूप से नियंत्रित करना" है - उपयोगकर्ता पोस्टर पर चीनी शीर्षक को अंग्रेजी में बदलने, इमोटिकॉन पैकेज में टेक्स्ट बबल टेक्स्ट को संशोधित करने, या उत्पाद छवि पर मूल्य टेक्स्ट को बदलने के लिए निर्दिष्ट कर सकते हैं - और संशोधन परिणाम प्राकृतिक एकीकरण को बनाए रखते हैं, जिससे संपादन का कोई निशान नहीं रह जाता है।

मुख्य पैरामीटर और आँकड़े

पैरामीटर आइटम विशेष विवरण
उत्पाद का नाम फ्लक्स-पाठ
श्रेणी एआई इमेज एडिटिंग/सीन टेक्स्ट एडिटिंग
डिलिवरी फॉर्म ओपन सोर्स मॉडल (पूर्व-प्रशिक्षित भार + अनुमान कोड)
ओपन सोर्स लाइसेंस आधिकारिक भंडार के अधीन
मॉडल वास्तुकला डिफ्यूजन ट्रांसफार्मर (DiT)
समर्थित भाषाएँ चीनी, अंग्रेजी और अन्य भाषाएँ
मुख्य कार्य दृश्य पाठ संपादन (छवियों में पाठ को संशोधित/जोड़ें/मिटाएं)
परियोजना स्वामित्व एएमएपी एमएल टीम (अलीबाबा/एएमएपी)
पेपर प्रकाशित arXiv (2025-05)
ओपन सोर्स प्लेटफार्म गिटहब + हगिंग फेस
डेमो वातावरण ग्रैडियो डेमो
अनुसंधान दल रुई लैन एट अल

फ्लक्स-टेक्स्ट और सामान्य प्रयोजन पाठ ड्राइंग मॉडल के बीच मूलभूत अंतर: पी-ड्राइंग सॉफ्टवेयर और सामान्य प्रयोजन एआई छवि उपकरण आमतौर पर छवियों में पाठ को संसाधित करते समय केवल "संपूर्ण छवि पुनर्रचना" कर सकते हैं, और विशिष्ट पाठ क्षेत्रों के संशोधन को सटीक रूप से नियंत्रित नहीं कर सकते हैं - वे पृष्ठभूमि, वर्ण या रचना को बदल सकते हैं। फ्लक्स-टेक्स्ट केवल निर्दिष्ट टेक्स्ट क्षेत्र पर काम करता है, छवि के अन्य हिस्सों को अपरिवर्तित छोड़ देता है। यह इसे पोस्टर संपादन, विज्ञापन संशोधन, अभिव्यक्ति पैक उत्पादन, उत्पाद छवि मूल्य अद्यतन इत्यादि जैसे परिदृश्यों में अपूरणीय बनाता है, जिसमें "केवल शब्दों को बदलने की आवश्यकता होती है, लेकिन छवि की नहीं"।

उपयोगकर्ता और बाज़ार की पहचान

एक अकादमिक ओपन सोर्स प्रोजेक्ट के रूप में, फ्लक्स-टेक्स्ट का प्रभाव मुख्य रूप से अनुसंधान समुदाय और ओपन सोर्स समुदाय में परिलक्षित होता है। पेपर arXiv (2025-05) पर प्रकाशित हुआ था और दृश्य पाठ संपादन (एसटीई) के उप-विभाजित अनुसंधान क्षेत्र में इस पर कुछ ध्यान दिया गया है। GitHub रिपॉजिटरी पूर्ण अनुमान कोड और पूर्व-प्रशिक्षित वजन प्रदान करता है, और हगिंग फेस पर होस्ट किया गया ग्रैडियो डेमो उपयोगकर्ताओं को मॉडल प्रभावों का ऑनलाइन अनुभव करने की अनुमति देता है।

वर्तमान में, FLUX-Text ने अभी तक एक व्यापक एंड-यूज़र बाज़ार नहीं बनाया है - इसका मुख्य दर्शक सी-एंड उपभोक्ताओं को सीधे लक्षित करने के बजाय AI शोधकर्ता और डेवलपर्स हैं। उत्पाद प्रपत्र SaaS प्लेटफ़ॉर्म के बजाय एक ओपन सोर्स मॉडल है, जिसका अर्थ है कि उपयोगकर्ताओं को इसका उपयोग करने के लिए कुछ तकनीकी क्षमताओं (पायथन पर्यावरण कॉन्फ़िगरेशन, मॉडल डाउनलोड और अनुमान) की आवश्यकता होती है। बाज़ार की पहचान के मुख्य संकेतक - पेपर उद्धरणों की संख्या, गिटहब स्टार्स और हगिंग फेस डाउनलोड - प्रत्येक प्लेटफ़ॉर्म के वास्तविक समय डेटा पर आधारित होने की अनुशंसा की जाती है, और यहां कोई सट्टा उद्धरण नहीं बनाया जाएगा।

लागत लाभ

लागत आयाम विवरण
सॉफ्टवेयर लाइसेंस $0 (खुला स्रोत मॉडल, आधिकारिक लाइसेंस के अधीन)
अनुमान कंप्यूटिंग GPU आवश्यक (16GB+ VRAM अनुशंसित), क्लाउड GPU किराया लगभग $0.5-2/घंटा है
तैनाती और संचालन Python और PyTorch पर्यावरण कॉन्फ़िगरेशन की आवश्यकता है
एपीआई सेवा कोई आधिकारिक होस्ट किया गया एपीआई नहीं; ग्रैडियो डेमो अनुसंधान और प्रदर्शन उद्देश्यों के लिए है

ओपन सोर्स मॉडल के मुख्य लागत लाभ: शून्य लाइसेंस शुल्क + पूरी तरह से अनुकूलन योग्य। सदस्यता ($10-60/माह) पर आधारित व्यावसायिक छवि संपादन SaaS (जैसे Adobe Firefly, Canva AI) की तुलना में, FLUX-Text निजी तैनाती और बैच प्रसंस्करण के लिए तकनीकी क्षमताओं वाली टीमों के लिए उपयुक्त है। ऐसे ई-कॉमर्स परिदृश्य के लिए, जिसमें हर दिन 1,000 उत्पाद छवियों के लिए टेक्स्ट प्रतिस्थापन की प्रक्रिया करने की आवश्यकता होती है, फ़्लक्स-टेक्स्ट को स्व-परिनियोजित करने की सीमांत लागत मुख्य रूप से GPU कंप्यूटिंग शक्ति (लगभग $15-30/दिन) है, जबकि वाणिज्यिक AI संपादन सेवाओं की थोक खरीद की लागत आमतौर पर $100-500/दिन है।

छिपी हुई लागत: मॉडल अनुमान के लिए GPU संसाधनों (16GB+ VRAM अनुशंसित) की आवश्यकता होती है, जिसका उपयोग सीधे गैर-तकनीकी उपयोगकर्ताओं द्वारा नहीं किया जा सकता है; मॉडल अपरंपरागत फ़ॉन्ट (जैसे लिखावट, शब्द कला) को संपादित करने के लिए आदर्श नहीं हो सकता है; वर्तमान संस्करण वीडियो में दृश्य पाठ संपादन का समर्थन नहीं करता है।

मुख्य कार्य

  • दृश्य पाठ संशोधन: छवि के निर्दिष्ट क्षेत्र में पाठ्य सामग्री को लक्ष्य पाठ से बदलें। उदाहरण के लिए: पोस्टर में "2025 स्प्रिंग कॉन्फ्रेंस" को "2025 समर प्रमोशन" में बदलें, और मॉडल स्वचालित रूप से मूल टेक्स्ट फ़ॉन्ट शैली, फ़ॉन्ट आकार, रंग और परिप्रेक्ष्य कोण से मेल खाता है, जिससे संशोधित टेक्स्ट मूल रूप से पृष्ठभूमि में मिश्रित हो जाता है।
  • दृश्य पाठ मिटाएँ: छवि में अवांछित पाठ क्षेत्रों को मिटा दें और मिटाए गए क्षेत्रों को उचित पृष्ठभूमि सामग्री से भरें। उदाहरण के लिए: उत्पाद छवियों से ब्रांड लोगो टेक्स्ट हटाएं, और स्क्रीनशॉट से टाइमस्टैम्प हटाएं। मिटाने के परिणाम पृष्ठभूमि की जटिलता पर निर्भर करते हैं - मिटाना ठोस रंग या समान रूप से बनावट वाली पृष्ठभूमि के साथ सबसे अच्छा काम करता है।
  • नया दृश्य पाठ: छवियों में रिक्त क्षेत्रों (जैसे दीवारें, बैनर, लेबल) में निर्दिष्ट पाठ डालें। नए पाठ की स्थिति उपयोगकर्ता द्वारा निर्दिष्ट की जाती है (एक आयताकार फ्रेम या मुखौटा द्वारा चिह्नित), और मॉडल स्वचालित रूप से क्षेत्र के परिप्रेक्ष्य संबंध और प्रकाश की स्थिति को निर्धारित करता है और उससे मेल खाने वाले पाठ प्रभाव उत्पन्न करता है।
  • बहुभाषी समर्थन: चीनी और अंग्रेजी में दृश्य पाठ संपादन का समर्थन करता है। दोनों भाषाओं को एक ही मॉडल ढांचे के तहत संसाधित किया जाता है, और चीनी और अंग्रेजी पाठ को एक ही छवि में मिश्रित और संपादित किया जा सकता है।
  • डिफ़ॉल्ट फ़ॉन्ट शैली माइग्रेशन: पाठ संपादित करते समय, मॉडल स्वचालित रूप से मूल पाठ की फ़ॉन्ट शैली (सेरिफ़/सैंस-सेरिफ़, वजन और झुकाव कोण) निकालता है और इसे लक्ष्य पाठ पर लागू करता है, उपयोगकर्ता को इसे मैन्युअल रूप से निर्दिष्ट करने की आवश्यकता के बिना।
  • पृष्ठभूमि स्थिरता: संपादन क्षेत्र के बाहर की छवि सामग्री बिल्कुल नहीं बदली जाती है - FLUX-Text केवल उपयोगकर्ता द्वारा निर्दिष्ट पाठ क्षेत्र पर काम करता है। यह सामान्य छवि संपादन मॉडल से इसका मुख्य अंतर है (ये मॉडल आसपास के क्षेत्रों को "संशोधित" करने के लिए प्रवण हैं)।

मॉडल और संस्करण विकास

संस्करण रिलीज की तारीख मुख्य परिवर्तन
v0.9 (अनुसंधान संस्करण) 2025-05-06 दृश्य पाठ संपादन की व्यवहार्यता को सत्यापित करने के लिए arXiv पेपर और प्रारंभिक तर्क कोड जारी करें
v1.0 (आधिकारिक संस्करण) 2025-07-04 ग्रैडियो डेमो और प्री-ट्रेनिंग वेट खोलें, बहुभाषी दृश्य टेक्स्ट संपादन का समर्थन करें

संस्करण रिकॉर्ड आधिकारिक GitHub रिलीज़ और arXiv पेपर संस्करणों के अधीन हैं। फ्लक्स-टेक्स्ट की पुनरावृत्त दिशा सामुदायिक प्रतिक्रिया और तकनीकी प्रगति के आधार पर अनुसंधान टीम द्वारा संचालित होती है। वर्तमान में कोई सार्वजनिक संस्करण रोडमैप नहीं है।

तकनीकी लाभ

  • डिफ्यूजन ट्रांसफार्मर (DiT) आर्किटेक्चर: फ्लक्स-टेक्स्ट पारंपरिक यू-नेट डिफ्यूजन मॉडल के बजाय डिफ्यूजन ट्रांसफार्मर पर आधारित है। डीआईटी आर्किटेक्चर छवि निर्माण गुणवत्ता में समान यू-नेट मॉडल से बेहतर प्रदर्शन करता है, स्पष्ट टेक्स्ट किनारों और अधिक प्राकृतिक बनावट संलयन प्रभाव पैदा करता है। प्रशिक्षण के दौरान मॉडल बड़े पैमाने पर छवि-पाठ जोड़ी डेटा + विशेष पाठ संपादन डेटा (संपादन से पहले/बाद में जोड़ी गई छवियों सहित) का उपयोग करता है।
  • पाठ-जागरूक ध्यान तंत्र: मॉडल प्रसार प्रक्रिया के दौरान पाठ क्षेत्र के ध्यान पूर्वाग्रह का परिचय देता है - अनुमान के दौरान, मॉडल गैर-संपादन क्षेत्र की विशेषताओं को अपरिवर्तित रखते हुए, उपयोगकर्ता द्वारा निर्दिष्ट संपादन क्षेत्र की पिक्सेल स्थिरता पर अधिक ध्यान देता है। इससे संपादन सीमाओं पर "प्रसार रिसाव" (संपादन क्षेत्र के बाहर के पिक्सेल गलती से संशोधित हो जाते हैं) की समस्या समाप्त हो जाती है।
  • परिप्रेक्ष्य और ज्यामितीय अनुकूलन: तिरछे पाठ के लिए जिसे सामने से शूट नहीं किया गया है (जैसे उत्पाद पैकेजिंग पर परिप्रेक्ष्य पाठ), मॉडल स्वचालित रूप से पाठ क्षेत्र के ज्यामितीय परिवर्तन मापदंडों (रोटेशन, स्केलिंग, परिप्रेक्ष्य मैट्रिक्स) का पता लगाता है, और लक्ष्य पाठ उत्पन्न करते समय उसी परिवर्तन को लागू करता है, ताकि संपादित पाठ मूल परिप्रेक्ष्य कोण के साथ दृष्टिगत रूप से सुसंगत हो।
  • सशर्त नियंत्रण इनपुट: उपयोगकर्ता टेक्स्ट मास्क (बाइनरी मास्क) के माध्यम से संपादन क्षेत्र को सटीक रूप से निर्दिष्ट कर सकते हैं, या रफ एनोटेशन के लिए एक आयताकार बॉक्स का उपयोग कर सकते हैं। नकाबपोश इनपुट मनमाने आकार के संपादन क्षेत्रों की अनुमति देता है, जबकि आयताकार बक्से बातचीत करने का अधिक सुविधाजनक तरीका प्रदान करते हैं।
  • प्रशिक्षण डेटा रणनीति: मॉडल सिंथेटिक डेटा + वास्तविक दृश्य डेटा की एक संकर प्रशिक्षण रणनीति का उपयोग करता है। मॉडल की बहुमुखी प्रतिभा सुनिश्चित करने के लिए सिंथेटिक डेटा बड़ी संख्या में फ़ॉन्ट, पृष्ठभूमि और परिप्रेक्ष्य परिवर्तनों को कवर करता है; वास्तविक दृश्य डेटा (इंटरनेट से एकत्र किए गए पाठ वाली वास्तविक छवियां) वास्तविक वातावरण में मॉडल की सामान्यीकरण क्षमता में सुधार करती हैं।

का उपयोग कैसे करें

कैसे उपयोग करें प्रवेश निर्देश
ग्रैडियो डेमो गले मिलते चेहरे की जगहें ऑनलाइन अनुभव, किसी स्थानीय तैनाती की आवश्यकता नहीं है (प्रतीक्षा करने के लिए कतार है)
स्थानीय अनुमान GitHub रिपोजिटरी क्लोन कोड → निर्भरताएँ स्थापित करें → भार डाउनलोड करें → अनुमान स्क्रिप्ट चलाएँ
पेपर पढ़ें आर्क्सिव तकनीकी विवरण और प्रायोगिक मूल्यांकन को समझें
मॉडल वजन गले मिलता हुआ चेहरा स्थानीय अनुमान के लिए पूर्व-प्रशिक्षित वज़न डाउनलोड करें

विशिष्ट उपयोग प्रक्रिया (स्थानीय परिनियोजन):

गिट क्लोन https://github.com/AMAP-ML/FluxText
सीडीफ्लक्सटेक्स्ट
पिप इंस्टॉल -आर आवश्यकताएँ.txt
पायथन run.py --इनपुट इमेज.jpg --मास्क मास्क.png --target_text "नया टेक्स्ट सामग्री"

इनपुट आवश्यकताएँ: एक मूल छवि जिसमें पाठ + एक मुखौटा छवि (या आयताकार फ्रेम निर्देशांक) है जो संपादन क्षेत्र + लक्ष्य पाठ सामग्री की पहचान करती है। आउटपुट: संपादित छवि फ़ाइल.

उत्पाद का मूल्य निर्धारण

उपयोग मॉडल फीस विवरण
ग्रैडियो डेमो (ऑनलाइन अनुभव) मुफ़्त अनुसंधान प्रदर्शन उपयोग, उपयोग प्रतिबंध और प्रतीक्षा कतारें
स्थानीय परिनियोजन (स्व-होस्टेड) ​​ $0 (सॉफ्टवेयर) + जीपीयू कंप्यूटिंग पावर लागत सॉफ़्टवेयर मुफ़्त और खुला स्रोत है, केवल हार्डवेयर या क्लाउड GPU लागत वहन की जाती है
व्यावसायिक उपयोग ओपन सोर्स लाइसेंस शर्तों के अधीन व्यावसायिक परिदृश्य पर लाइसेंस प्रकार की बाधाओं की पुष्टि करें

व्यक्तिगत शोधकर्ताओं और एआई उत्साही लोगों के लिए, ग्रैडियो डेमो कभी-कभी छवि पाठ संपादन आवश्यकताओं को पूरा कर सकता है, लेकिन कतार और समवर्ती सीमाओं द्वारा सीमित है। उत्पादन परिवेश में बैच उपयोग के लिए स्थानीय परिनियोजन की अनुशंसा की जाती है, और क्लाउड जीपीयू किराये की लागत लगभग $0.5-2/घंटा (जीपीयू मॉडल के आधार पर) है।

अनुप्रयोग परिदृश्य

  • पोस्टर और विज्ञापन छवियों का बैच संशोधन: मार्केटिंग टीम प्रमुख प्रचारों से पहले और बाद में अक्सर पोस्टर में तारीख, कीमत और घटना की जानकारी को संशोधित करती है। बैचों में टेक्स्ट को बदलने के लिए FLUX-Text का उपयोग करना PS में उन्हें एक-एक करके मैन्युअल रूप से संशोधित करने की तुलना में 10-50 गुना अधिक कुशल है। सत्यापन विधि: बैच संशोधन की सटीकता (पाठ स्थिति/आकार/कोण मूल छवि के अनुरूप है) और मैन्युअल सुधार अनुपात की तुलना करें।
  • उत्पाद छवि मूल्य और पैरामीटर अपडेट: ई-कॉमर्स ऑपरेशन टीम नियमित रूप से उत्पाद मुख्य छवि पर मूल्य, प्रचार लेबल और विनिर्देश पैरामीटर अपडेट करती है। फ्लक्स-टेक्स्ट पृष्ठभूमि और अन्य दृश्य तत्वों को अपरिवर्तित छोड़कर, एक निर्दिष्ट क्षेत्र में मूल्य संख्याओं को सटीक रूप से बदल सकता है। सत्यापन विधि: क्या प्लेटफ़ॉर्म पर संपादित उत्पाद छवि की क्लिक-थ्रू दर और रूपांतरण दर संपादन ट्रेस से प्रभावित होती है।
  • इमोटिकॉन और सोशल मीडिया ग्राफिक निर्माण: सामग्री निर्माता इमोटिकॉन्स में टेक्स्ट बबल सामग्री को संशोधित कर सकते हैं और स्क्रीनशॉट में संवाद टेक्स्ट को प्रतिस्थापित कर सकते हैं। सत्यापन विधि: क्या संपादन के निशान दृष्टिगत रूप से पता लगाने योग्य हैं।
  • दस्तावेज़ और स्क्रीनशॉट डिसेन्सिटाइजेशन: आंतरिक दस्तावेज़ स्क्रीनशॉट साझा करने से पहले संवेदनशील जानकारी (नाम, फ़ोन नंबर, ईमेल, आदि) को मिटाने के लिए FLUX-Text का उपयोग करें, जो मैन्युअल मोज़ेक की तुलना में अधिक स्वाभाविक है। सत्यापन विधि: मिटाए गए क्षेत्रों में पृष्ठभूमि भरने की स्वाभाविकता का आकलन।
  • मूवी और गेम उपशीर्षक प्रतिस्थापन: वीडियो फ्रेम में टेक्स्ट को बदलें (जैसे कि गेम यूआई में चीनी को अंग्रेजी से बदलना), जिसे फ्रेम दर फ्रेम संसाधित करने की आवश्यकता होती है। नोट: वर्तमान संस्करण एकल छवि संपादन के लिए है, और वीडियो प्रसंस्करण को फ्रेम दर फ्रेम निष्पादित करने की आवश्यकता है।

लागू लोग

भीड़ अनुकूलन मूल्य पूर्व शर्ते
एआई शोधकर्ता अनुसंधान दृश्य पाठ संपादन एल्गोरिदम, जिसका उपयोग आधारभूत तुलना के रूप में किया जा सकता है पायथन + PyTorch वातावरण
ई-कॉमर्स संचालन और डिजाइन टीम उत्पाद छवियों और पोस्टर पाठ का बैच संशोधन ग्रेडियो डेमो को तैनात करने या उपयोग करने में सहायता के लिए तकनीकी छात्रों की आवश्यकता होती है
सामग्री निर्माता इमोटिकॉन पैक और सोशल मीडिया ग्राफिक्स और टेक्स्ट संशोधन ग्रैडियो डेमो हल्के उपयोग के लिए पर्याप्त है
डेटा डिसेन्सिटाइजेशन टीम दस्तावेज़ स्क्रीनशॉट में संवेदनशील जानकारी मिटाना बड़ी मात्रा में डेटा संसाधित करने के लिए स्थानीय परिनियोजन की आवश्यकता होती है
भीड़ के लिए उपयुक्त नहीं कारण
--- ---
बिना तकनीकी पृष्ठभूमि वाले सामान्य उपयोगकर्ता मूल उपयोग के लिए कमांड लाइन ऑपरेशन की आवश्यकता होती है
वे दृश्य जिनमें वीडियो संपादन की आवश्यकता है वर्तमान में केवल एकल छवियां समर्थित हैं, और वीडियो को फ्रेम दर फ्रेम संसाधित करने की आवश्यकता है
पेशेवर डिज़ाइन जिनमें फ़ॉन्ट बहाली के लिए अत्यधिक उच्च आवश्यकताएं हैं गैर-मानक फ़ॉन्ट की बहाली की डिग्री अपर्याप्त हो सकती है

सारांश और आउटलुक

फ्लक्स-टेक्स्ट दृश्य पाठ संपादन (एसटीई) के अत्यधिक विशिष्ट क्षेत्र में एक उच्च गुणवत्ता वाला खुला स्रोत समाधान प्रदान करता है। इसका मूल मूल्य "अन्य दृश्य तत्वों को प्रभावित किए बिना छवि में पाठ सामग्री को सटीक रूप से नियंत्रित करना" में निहित है - अतीत में, इसके लिए या तो पेशेवर डिजाइनरों को पिक्सेल द्वारा पिक्सेल को मैन्युअल रूप से संसाधित करने की आवश्यकता होती थी (एक एकल छवि में 15-60 मिनट लगते थे), या केवल पूरी छवि को फिर से बनाकर अप्रत्यक्ष रूप से प्राप्त किया जा सकता था लेकिन यह अनियंत्रित था। FLUX-Text संपादन परिणामों की पेशेवर-ग्रेड दृश्य गुणवत्ता को बनाए रखते हुए इस ऑपरेशन के लिए आवश्यक समय को सेकंड तक कम कर देता है।

वर्तमान सीमाएँ: (1) मॉडल अनुमान के लिए GPU संसाधनों (अनुशंसित 16GB+ VRAM) की आवश्यकता होती है, जो ओपन सोर्स के "शून्य सीमा" लाभ को कमजोर करता है - उपयुक्त हार्डवेयर के बिना उपयोगकर्ताओं को केवल ग्रेडियो डेमो के माध्यम से सीमित अनुभव हो सकता है; (2) अपरंपरागत फ़ॉन्ट (लिखावट, कलात्मक टाइपफेस, सजावटी फ़ॉन्ट) पर पाठ संपादन प्रभाव अस्थिर है - इन फ़ॉन्ट पर मॉडल का प्रशिक्षण डेटा कवरेज अपर्याप्त हो सकता है; (3) वर्तमान में केवल एकल छवि प्रसंस्करण का समर्थन करता है, और बैच प्रसंस्करण पाइपलाइनों या वीडियो दृश्य पाठ संपादन का समर्थन नहीं करता है; (4) मॉडल द्वारा टेक्स्ट आउटपुट में सूक्ष्म दृश्य दोष (जैसे असंतत स्ट्रोक और रंग विचलन) हो सकते हैं, जिन्हें बड़ा करके देखने पर देखा जा सकता है। खरीद/गोद लेने के सुझाव: ई-कॉमर्स और मार्केटिंग टीमें पहले वास्तविक चित्रों (50-100 चित्रों) की एक छोटी संख्या पर बैच परीक्षण करने की सलाह देती हैं ताकि यह मूल्यांकन किया जा सके कि संपादन गुणवत्ता सटीकता और दृश्य स्वाभाविकता के लिए व्यावसायिक आवश्यकताओं को पूरा करती है या नहीं। अनुसंधान दल अपने डेटा सेट को बेहतर बनाने के लिए वज़न और कोड को सीधे डाउनलोड कर सकते हैं। अनुवर्ती निर्देशों में शामिल हैं: मॉडल अनुमान गति का अनुकूलन (बैच प्रसंस्करण का समर्थन), अधिक भाषाओं के लिए समर्थन, और अन्य छवि संपादन क्षमताओं के साथ एकीकरण (जैसे पृष्ठभूमि प्रतिस्थापन + पाठ संपादन संयुक्त संचालन)।

संबंधित उपकरण: <एक्सलिंक प्रकार='टूल' स्लग='क्रूवाई'>, <एक्सलिंक प्रकार='टूल' स्लग='लैंगचेन'>

संस्करण जानकारी

  • फ्लक्स-टेक्स्ट आधिकारिक संस्करण :ग्रैडियो डेमो और पूर्व-प्रशिक्षित वेट खोलें, और बहुभाषी दृश्य पाठ संपादन का समर्थन करें।
  • प्रारंभिक अनुसंधान संस्करण :दृश्य पाठ संपादन की व्यवहार्यता को सत्यापित करने के लिए arXiv पेपर और प्रारंभिक तर्क कोड जारी करें।

उपयोगकर्ता समीक्षाएं

  • समीक्षाएं लोड हो रही हैं...