जी.पी.डी.आई मुफ्त

-

GPDiT (जेनरेटिव प्री-ट्रेंड ऑटोरेग्रेसिव डिफ्यूजन ट्रांसफार्मर) चीन के विज्ञान और प्रौद्योगिकी विश्वविद्यालय और स्टेप स्टार द्वारा संयुक्त रूप से प्रस्तावित एक ऑटोरेग्रेसिव डिफ्यूजन वीडियो जेनरेशन मॉडल है। यह निरंतर अव्यक्त स्थान में फ्रेम-स्तरीय ऑटोरेग्रेसिव भविष्यवाणी करता है, और ऑटोरेग्रेसिव मॉडल के समय मॉडलिंग लाभों के साथ प्रसार मॉडल की उच्च गुणवत्ता वाली पीढ़ी क्षमताओं को एकीकृत करता है। यह MSRVTT और UCF-101 बेंचमार्क पर उस समय के इष्टतम स्तर पर पहुंच गया है।

जी.पी.डी.आई उत्पाद इंटरफेस

GPDiT की पूर्ण समीक्षा

मुख्य पैरामीटर और आँकड़े

GPDiT (जेनरेटिव प्री-ट्रेंड ऑटोरेग्रेसिव डिफ्यूजन ट्रांसफार्मर) को चीन के विज्ञान और प्रौद्योगिकी विश्वविद्यालय और स्टेप स्टार द्वारा संयुक्त रूप से प्रस्तावित किया गया था। इसका उद्देश्य प्रसार मॉडल की उच्च-गुणवत्ता वाली पीढ़ी क्षमताओं और ऑटोरेग्रेसिव मॉडल की अस्थायी निर्भरता मॉडलिंग क्षमताओं को एक ही ढांचे के भीतर एकीकृत करना है। असतत टोकन भविष्यवाणी मार्गों के विपरीत, GPDiT एक निरंतर अव्यक्त स्थान में फ्रेम दर फ्रेम ऑटोरेग्रेसिव भविष्यवाणियां करता है, एक समय में एक फ्रेम की भविष्यवाणी करता है और प्रसार हानि के माध्यम से अनुकूलन करता है, जिससे मॉडल को स्वाभाविक रूप से अंतर-फ्रेम गति गतिशीलता और सिमेंटिक स्थिरता को पकड़ने की अनुमति मिलती है।

प्रोजेक्ट विशेष विवरण
पूरा नाम जनरेटिव पूर्व-प्रशिक्षित ऑटोरेग्रेसिव डिफ्यूजन ट्रांसफार्मर
प्रकाशन एजेंसी चीन के विज्ञान और प्रौद्योगिकी विश्वविद्यालय (यूएसटीसी), स्टेपफन
arXiv आईडी 2505.07344 (v5, 2025-10-08)
विषय क्षेत्र सीएस.सीवी (कंप्यूटर विजन और पैटर्न पहचान), सीएस.एआई (कृत्रिम बुद्धिमत्ता)
मॉडल आकार GPDiT-B (85M पैरामीटर), GPDiT-H (2B पैरामीटर)
तकनीकी रोडमैप फ्रेम-वार ऑटोरेग्रेसिव डिफ्यूजन ट्रांसफार्मर (फ्रेम-वार ऑटोरेग्रेसिव डिफ्यूजन)
कोर इनोवेशन निरंतर अव्यक्त अंतरिक्ष फ्रेम भविष्यवाणी + हल्का कारण ध्यान + पैरामीटर-मुक्त घूर्णी अस्थायी एन्कोडिंग
प्रशिक्षण डेटा UCF-101, MSR-VTT, LAION-एस्थेटिक, आंतरिक वीडियो डेटा सेट
सार्वजनिक रूप arXiv पेपर (कोड और मॉडल ओपन सोर्स नहीं हैं)
ओपन सोर्स लाइसेंस arXiv गैर-अनन्य वितरण लाइसेंस

मॉडल विशिष्टताओं की तुलना: GPDiT-B, DiT-B कॉन्फ़िगरेशन का अनुसरण करता है, जिसमें ट्रांसफार्मर की 12 परतें, 768 छिपे हुए आयाम और ध्यान के 12 प्रमुख, और केवल 85M की पैरामीटर मात्रा होती है; GPDiT-H को 24 परतों, 2816 छिपे हुए आयामों, 22 ध्यान बिंदुओं और 2B की पैरामीटर मात्रा तक विस्तारित किया गया है। यह डुअल-ट्रैक डिज़ाइन शोधकर्ताओं को संसाधन-बाधित परिदृश्यों में विचारों को सत्यापित करने के लिए छोटे मॉडल का उपयोग करने की अनुमति देता है, और जब कंप्यूटिंग शक्ति पर्याप्त होती है, तो इष्टतम पीढ़ी की गुणवत्ता को आगे बढ़ाने के लिए बड़े पैमाने पर संस्करण पर स्विच करें।

मुख्य प्रदर्शन आंकड़े: GPDiT-H-LONG ने MSRVTT जीरो-सैंपल जेनरेशन पर FVD 64 और FID 7.4 हासिल किया, इसी अवधि में स्नैपवीडियो (FVD 110) को लगभग 42% से पीछे छोड़ दिया; यूसीएफ-101 पर, यह एफवीडी 218 और आईएस 66.6 प्राप्त करता है, और आईएस संकेतक पिक्सेलडांस (42.1) से लगभग 58% अधिक है। GPDiT-B (80M पैरामीटर) ने UCF-101 प्रशिक्षण पर FVD 214 हासिल किया, और 130M पैरामीटर के FAR (FVD 194) के साथ अंतर 10% के भीतर है, जो हल्के आर्किटेक्चर के दक्षता लाभ को दर्शाता है।

प्रचार सत्यापन: MSRVTT और UCF-101 पर पेपर के मात्रात्मक परिणामों को सत्यापित किया जा सकता है, और समान अवधि के तरीकों की तुलना में लाभ स्पष्ट हैं। हालाँकि, कोड और मॉडल वेट खुला स्रोत नहीं हैं, और तृतीय-पक्ष स्वतंत्र पुनरुत्पादन अभी तक सामने नहीं आया है। सभी मान पेपर द्वारा स्व-रिपोर्ट किए गए हैं।

उपयोगकर्ता और बाज़ार की पहचान

GPDiT वर्तमान में अकादमिक पेपर चरण में है, और बाजार की मान्यता अकादमिक उद्धरणों और सामुदायिक ध्यान में परिलक्षित होती है। अभी तक कोई व्यावसायीकरण या उद्यम अपनाने का डेटा नहीं है।

शैक्षणिक समुदाय का ध्यान: पेपर मई 2025 में अंतिम संस्करण के लिए अक्टूबर में प्रस्तुत किया गया था, और arXiv पर 5 संस्करण पुनरावृत्तियों से गुजरा है, यह दर्शाता है कि लेखक टीम प्रयोगों और प्रदर्शनों में सुधार करना जारी रख रही है। यह पेपर हगिंग फेस डेली पेपर्स ट्रेंड में दिखाई देता है, जिससे कुछ सामुदायिक प्रदर्शन प्राप्त होता है।

संस्थागत समर्थन: चीन के विज्ञान और प्रौद्योगिकी विश्वविद्यालय (यूएसटीसी) के पास सीवी और एआई के क्षेत्र में गहन संचय है, और स्टेपफन घरेलू वीडियो जेनरेशन ट्रैक में एक महत्वपूर्ण खिलाड़ी है (इसने स्टेप-वीडियो श्रृंखला लॉन्च की है)। दोनों संस्थानों का संयुक्त प्रकाशन उद्योग-विश्वविद्यालय-अनुसंधान एकीकरण के स्तर पर पेपर को विश्वसनीयता प्रदान करता है।

उद्धरण और पुनरुत्पादन: वर्तमान समय में, पेपर के लिए कोई सार्वजनिक तृतीय-पक्ष पुनरुत्पादन रिपोर्ट या कोड भंडार नहीं है। यह एक अकादमिक पेपर के लिए एक सामान्य ताल है - अधिकांश शीर्ष सीवी कॉन्फ्रेंस पेपरों में प्रकाशन के 3-6 महीने बाद तक सामुदायिक प्रतिकृति नहीं दिखती है। इस बात पर ध्यान देने की अनुशंसा की जाती है कि भविष्य में आधिकारिक या तृतीय-पक्ष कोड खुला स्रोत होगा या नहीं।

उद्योग बेंचमार्क स्थिति: GPDiT का 2B पैरामीटर स्केल स्नैपवीडियो (3.9B) और PixelDance (1.5B) के समान परिमाण के क्रम में है, लेकिन MSRVTT पर FVD 64 का इसका प्रदर्शन उस समय पहले स्तर पर था। हालाँकि, डेमो और एपीआई की कमी के कारण, इसकी सी-साइड धारणा रनवे और पिका जैसे वाणिज्यिक उत्पादों की तुलना में बहुत कम है।

लागत लाभ

GPDiT वर्तमान में पूरी तरह से कागजात के रूप में मौजूद है, एक बहुत ही सरल लागत संरचना के साथ- कागजात मुफ्त में उपलब्ध हैं, लेकिन प्रयोगों को पुन: पेश करने के लिए महत्वपूर्ण कंप्यूटिंग शक्ति निवेश की आवश्यकता होती है।

आयाम सार्वजनिक सूचना
पेपर पढ़ना arXiv मुफ़्त है और जनता के लिए खुला है, PDF/HTML/TeX स्रोत कोड का समर्थन करता है
कोड और मॉडल खुला स्रोत नहीं है और इसे डाउनलोड और उपयोग नहीं किया जा सकता
एपीआई सेवा प्रदान नहीं किया गया
GPDiT-B पुनरावृत्ति लागत (कटौती) 32 एच100 जीपीयू × 400k पुनरावृत्तियाँ × लगभग 2-3 दिन
GPDiT-H पुनरावृत्ति लागत (कटौती) मल्टी-स्टेज प्रशिक्षण: 200k + 200k + 150k पुनरावृत्तियाँ, कुल मिलाकर लगभग 1-2 सप्ताह × 64+ H100
कुछ-नमूना फाइन-ट्यूनिंग लागत (कटौती) 500 पुनरावृत्तियों × बैच 4 × को एक ही कार्ड से पूरा किया जा सकता है

मुफ़्त सच: यह सच है कि पेपर पढ़ने के लिए मुफ़्त हैं, लेकिन "उपयोग" की छिपी हुई लागत बहुत अधिक है। GPDiT-B का प्रशिक्षण 400k पुनरावृत्तियों के लिए 32 H100 GPU का उपयोग करता है। क्लाउड विक्रेता H100 के अनुसार गणना की गई, जो लगभग $3-4/कार्ड घंटा है, एक पूर्ण पुनरुत्पादन की कंप्यूटिंग शक्ति लागत $10,000-20,000 के क्रम पर है। GPDiT-H के बहु-स्तरीय प्रशिक्षण के लिए उच्च कंप्यूटिंग शक्ति की आवश्यकता होती है, जो सामान्य शैक्षणिक प्रयोगशालाओं के लिए वहनीय नहीं है।

व्यावसायिक एपीआई के साथ अंतर्निहित लागत की तुलना: यदि लक्ष्य केवल "वीडियो उत्पन्न करना" है, तो सीधे रनवे जेन-3 (~$0.05-0.10/सेकंड) या पिका (सदस्यता $10-50/माह) का उपयोग करना वर्तमान चरण में स्व-प्रशिक्षण GPDiT की सीमांत लागत से बहुत कम है। GPDiT का मूल्य आउट-ऑफ़-द-बॉक्स लागत लाभों के बजाय प्रौद्योगिकी अन्वेषण और वास्तुशिल्प नवाचार में निहित है।

अनुपालन जोखिम: यह पेपर arXiv गैर-अनन्य वितरण लाइसेंस का उपयोग करता है, जो विद्वानों के उद्धरण और व्युत्पन्न अनुसंधान की अनुमति देता है। हालाँकि, यदि कोई भविष्य में थीसिस समाधान के आधार पर एक वाणिज्यिक मॉडल को प्रशिक्षित करता है, तो उन्हें स्टेपफन और यूएसटीसी के पास मौजूद पेटेंट या बौद्धिक संपदा अधिकारों पर ध्यान देने की आवश्यकता है, और व्यावसायिक उपयोग से पहले एक एफटीओ (कार्यान्वयन करने की स्वतंत्रता) विश्लेषण आयोजित किया जाना चाहिए।

मुख्य कार्य

GPDiT की क्षमताएं तीन स्तरों पर केंद्रित हैं: वीडियो निर्माण, वीडियो प्रतिनिधित्व सीखना और कुछ-नमूना बहु-कार्य स्थानांतरण:

  • फ़्रेम-स्तरीय ऑटोरेग्रेसिव वीडियो जेनरेशन: निरंतर अव्यक्त स्थान में फ़्रेम दर फ़्रेम भविष्य के फ़्रेम की भविष्यवाणी करें, और प्रत्येक फ़्रेम पहले से उत्पन्न सभी फ़्रेमों के आधार पर उत्पन्न होता है। यह डिज़ाइन निश्चित-लंबाई वाले वीडियो निर्माण की सीमाओं को तोड़ता है और सैद्धांतिक रूप से किसी भी लंबाई के वीडियो अनुक्रम उत्पन्न कर सकता है। असतत टोकन ऑटोरेग्रेसिव मॉडल की तुलना में, निरंतर स्थानिक भविष्यवाणी वीक्यू टोकनाइज़र की सूचना हानि की समस्या से बचाती है।

  • दो कारणात्मक ध्यान वैरिएंट (OF / OF2): OF (केवल पूर्व) वैरिएंट प्रशिक्षण के दौरान साफ ​​फ़्रेमों के बीच ध्यान गणना को समाप्त करता है, गणना की मात्रा को लगभग 50% तक कम करने के लिए वीडियो फ़्रेम के बीच स्थानिक अतिरेक का उपयोग करता है; OF2 वैरिएंट मजबूत प्रतिनिधित्व क्षमताओं के बदले में स्वच्छ फ्रेम के बीच बातचीत को बरकरार रखता है। दोनों स्वाभाविक रूप से अनुमान के दौरान केवी कैश त्वरण के साथ संगत हैं, और लंबे अनुक्रम पीढ़ी की दक्षता द्विदिश ध्यान योजना की तुलना में काफी अधिक है।

  • पैरामीटर रहित रोटेशन समय एन्कोडिंग: पारंपरिक adaLN-ज़ीरो मॉड्यूल को रोटेशन कोण $\theta_t$ के साथ प्रतिस्थापित करते हुए, जटिल विमान पर रोटेशन ऑपरेशन के रूप में प्रसार आगे की प्रक्रिया को दोबारा परिभाषित करें। यह डिज़ाइन समय स्थिति सबमॉड्यूल को हटा देता है, जो डीआईटी मॉडल के लगभग 28% मापदंडों के लिए जिम्मेदार है, और पैरामीटर दक्षता में स्पष्ट लाभ हैं।

  • कुछ-नमूना बहु-कार्य स्थानांतरण: पूर्व-प्रशिक्षित GPDiT मॉडल को स्टाइल ट्रांसफर, एज डिटेक्शन, गहराई अनुमान, मानव पहचान, छवि रंगीकरण इत्यादि जैसे विभिन्न डाउनस्ट्रीम कार्यों में स्थानांतरित करने के लिए केवल 20 वीडियो नमूने (20 शॉट्स) और 500 फाइन-ट्यूनिंग पुनरावृत्तियों की आवश्यकता होती है। यह क्षमता अतिरिक्त अनुकूलन मॉड्यूल की आवश्यकता के बिना निरंतर ऑटोरेग्रेसिव ढांचे की प्राकृतिक स्थिति स्प्लिसिंग तंत्र से लाभ उठाती है।

  • वीडियो प्रतिनिधित्व सीखना: GPDiT की मध्य-परत सुविधाओं का उपयोग सीधे वीडियो समझने के कार्यों के लिए किया जा सकता है। रैखिक पहचान प्रयोगों से पता चलता है कि GPDiT-H सुविधाओं में UCF-101 वर्गीकरण पर काफी प्रतिनिधित्व गुणवत्ता है, और वीडियो-चैटजीपीटी ढांचे में CLIP विज़ुअल एनकोडर को बदलने के बाद एक्टिविटीनेट-क्यूए पर 28.2% सटीकता प्राप्त होती है।

विशेषज्ञ दृष्टिकोण: GPDiT के कार्यात्मक डिज़ाइन में "छिपा हुआ तालमेल" है - इसकी ऑटोरेग्रेसिव वास्तुकला स्वाभाविक रूप से "पीढ़ी + समझ" के एकीकरण का समर्थन करती है। पारंपरिक समाधानों में, वीडियो जेनरेशन मॉडल (जैसे स्टेबल वीडियो डिफ्यूजन) और वीडियो समझ मॉडल (जैसे वीडियोएमएई) दो स्वतंत्र आर्किटेक्चर हैं। जेनरेशन कार्य पर GPDiT के पूर्व-प्रशिक्षित भार को सीधे कार्यों को समझने के लिए फीचर एक्सट्रैक्टर्स के रूप में उपयोग किया जा सकता है, और जेनरेशन गुणवत्ता में सुधार सकारात्मक रूप से प्रतिनिधित्व क्षमताओं के सुधार के साथ सहसंबद्ध है (पेपर का चित्र 5c FVD और वर्गीकरण सटीकता के एक साथ सुधार की पुष्टि करता है), जिसका अर्थ है कि एक ही मॉडल वीडियो सामग्री निर्माण और वीडियो विश्लेषण परिदृश्यों दोनों की सेवा कर सकता है।

मॉडल और संस्करण विकास

संस्करण संदर्भ

GPDiT arXiv पर 5 संस्करण पुनरावृत्तियों से गुज़रा है, और पहले संस्करण से अंतिम संस्करण तक लगभग 5 महीने लगे:

संस्करण दिनांक मुख्य परिवर्तन
v1 2025-05-12 पहला सबमिशन, GPDiT-B (85M) और GPDiT-H (2B) आर्किटेक्चर का प्रस्ताव, UCF-101 और MSRVTT पर बुनियादी परिणामों की रिपोर्टिंग
v2 2025-05-15 संशोधित प्रायोगिक सेटिंग्स और पूरक उच्छेदन अनुसंधान
v3 2025-05-19 संबंधित कार्य और प्रयोगात्मक विवरण में सुधार करें
v4 2025-05-22 वीडियो प्रतिनिधित्व सीखने और अधिक नमूना परिणामों का पूरक रैखिक पहचान प्रयोग
v5 2025-10-08 अंतिम संस्करण, GPDiT-H-LONG वेरिएंट को जोड़कर, 17-45 फ्रेम वैरिएबल लंबाई पीढ़ी का समर्थन करते हुए, MSRVTT पर FVD को घटाकर 64 कर दिया गया

मॉडल विविधताएँ

GPDiT प्रणाली में तीन मुख्य प्रकार होते हैं:

  • GPDiT-B (85M पैरामीटर): बुनियादी बेंचमार्क मॉडल, 400k पुनरावृत्तियों के लिए UCF-101 पर स्क्रैच से प्रशिक्षित, संसाधन-विवश सत्यापन और पृथक्करण प्रयोगों के लिए उपयुक्त।
  • GPDiT-H (2B पैरामीटर): बड़े पैमाने पर संस्करण, पहले LAION-एस्थेटिक छवि डेटा पर 200k पुनरावृत्तियों को वार्म-अप करें, फिर मिश्रित छवि-वीडियो डेटा पर 200k पुनरावृत्तियों को प्रशिक्षित करें, और अंत में शुद्ध वीडियो डेटा पर 150k पुनरावृत्तियों को फाइन-ट्यून करें।
  • GPDiT-H-LONG: GPDiT-H पर आधारित, लंबी अनुक्रम पीढ़ी क्षमताओं को बढ़ाने के लिए 150k पुनरावृत्तियों के लिए प्रशिक्षण जारी रखने के लिए परिवर्तनीय लंबाई (17-45 फ्रेम) वीडियो डेटा का उपयोग करें।

तकनीकी लाभ

GPDiT के तकनीकी लाभों को तीन स्तरों में विभाजित किया जा सकता है, जिनमें से प्रत्येक सीधे विशिष्ट दक्षता या गुणवत्ता लाभ से मेल खाता है:

फ़्रेम-स्तरीय कारण ध्यान केवी कैश के साथ संगत है: पारंपरिक द्विदिश ध्यान लंबे वीडियो निर्माण में दो समस्याओं का सामना करता है-भविष्य के फ्रेम सूचना रिसाव अस्थायी स्थिरता को नष्ट कर देता है, और अनुमान के दौरान केवी कैश का उपयोग करने में असमर्थता के कारण फ्रेम की वर्ग संख्या के साथ गणना की मात्रा बढ़ जाती है। GPDiT फ़्रेम-स्तरीय कारणात्मक ध्यान को अपनाता है, और प्रत्येक शोर वाला फ़्रेम केवल उन साफ़ फ़्रेमों पर ध्यान देता है जो अतीत में और स्वयं उत्पन्न हुए हैं। यह डिज़ाइन स्वाभाविक रूप से अनुमान के दौरान केवी कैश का समर्थन करता है, जिससे लंबी अनुक्रम पीढ़ी की कम्प्यूटेशनल जटिलता $\mathcal{O}(F^2)$ से $\mathcal{O}(F)$ तक कम हो जाती है। प्रयोगों से पता चलता है कि प्रशिक्षण अवधि से अधिक लंबे वीडियो बनाते समय GPDiT स्थिर गुणवत्ता बनाए रखता है, जबकि द्विदिश ध्यान योजनाओं को गंभीर गिरावट का सामना करना पड़ता है।

हल्के कारण ध्यान: मानक कारण ध्यान को प्रशिक्षण के दौरान एक ही समय में साफ फ्रेम और शोर फ्रेम के प्रतिनिधित्व के दो सेट बनाए रखने की आवश्यकता होती है, जिसके परिणामस्वरूप वीडियो मेमोरी और गणना दोगुनी हो जाती है। GPDiT वीडियो के निकटवर्ती फ़्रेमों के बीच बड़ी मात्रा में स्थानिक अतिरेक देखता है और इसलिए प्रशिक्षण के दौरान साफ़ फ़्रेमों के बीच ध्यान गणना को सीधे छोड़ देता है। यह अनुकूलन पीढ़ी की गुणवत्ता से समझौता किए बिना ध्यान गणना को लगभग 50% कम कर देता है (GPDiT-B-OF और GPDiT-B-OF2 ​​​​के बीच FVD अंतर केवल 2 अंक है: 216 बनाम 214)।

पैरामीटर रहित रोटेशन टाइम कोडिंग (रोटेशन-आधारित टाइम कंडीशनिंग): DiT जैसे मुख्यधारा प्रसार ट्रांसफार्मर समय चरण की जानकारी इंजेक्ट करने के लिए adaLN-Zero का उपयोग करते हैं। यह मॉड्यूल मॉडल के कुल मापदंडों का लगभग 28% हिस्सा है। GPDiT प्रसार आगे की प्रक्रिया $x_t = \sqrt{\bar{\alpha}_t} x_0 + \sqrt{1-\bar{\alpha}_t} \epsilon$ को 2D जटिल समतल घूर्णन के रूप में पुनः व्याख्या करता है:

$$R(\theta_t) = \begin{pmatrix} \cos\theta_t और \sin\theta_t \ -\sin\theta_t और \cos\theta_t \end{pmatrix}$$

जहां $\cos\theta_t = \sqrt{\bar{\alpha}_t}$, $\sin\theta_t = \sqrt{1-\bar{\alpha}_t}$. मॉडल रिवर्स रोटेशन के माध्यम से अस्थायी जानकारी को अंतर्निहित रूप से इंजेक्ट करता है, एडीएएलएन-जीरो के एमएलपी मापदंडों को पूरी तरह से हटा देता है, तुलनीय पीढ़ी की गुणवत्ता को बनाए रखते हुए मापदंडों की संख्या को काफी कम कर देता है।

निरंतर स्थानिक ऑटोरिग्रेशन बनाम असतत टोकन ऑटोरिग्रेशन: मौजूदा ऑटोरिग्रेशन वीडियो विधियां (जैसे वीडियोपोएट, ओमनीटोकनाइज़र) वीडियो फ्रेम को अलग-अलग टोकन में परिमाणित करने के लिए वीक्यू-वीएई पर निर्भर करती हैं। इस मैपिंग में अपरिवर्तनीय सूचना हानि शामिल है। GPDiT एक सतत अव्यक्त स्थान में काम करता है और फ्रेम भविष्यवाणी के लिए क्रॉस-एन्ट्रॉपी हानि के बजाय प्रसार हानि का उपयोग करता है, विवेक की सटीकता की बाधा से बचता है। यह लाभ विशेष रूप से कुछ-शॉट कार्यों पर स्पष्ट है - GPDiT अतिरिक्त एडेप्टर के बिना अनुक्रम स्प्लिसिंग के माध्यम से स्थिति निर्माण को पूरा कर सकता है, जबकि असतत टोकन विधियों के लिए आमतौर पर विशेष मैपिंग मॉड्यूल के प्रशिक्षण की आवश्यकता होती है।

कैसे उपयोग करें

GPDiT वर्तमान में केवल अकादमिक पेपर के रूप में सार्वजनिक रूप से उपलब्ध है, जिसमें कोई सीधे उपयोग योग्य कोड, मॉडल वेट या ऑनलाइन डेमो नहीं है। उपयोग पथ को निम्नलिखित स्तरों में विभाजित किया गया है:

कैसे उपयोग करें भीड़ के लिए उपयुक्त वर्तमान व्यवहार्यता संसाधन आवश्यकताएँ
पेपर पढ़ें शोधकर्ता, एल्गोरिदम इंजीनियर ✅ arXiv पूर्ण पाठ सार्वजनिक कोई नहीं
संदर्भ वास्तुकला डिजाइन वीडियो जनरेशन शोधकर्ता ✅ पेपर संपूर्ण तकनीकी विवरण प्रदान करता है कोई नहीं
GPDiT-B को पुन: प्रस्तुत करें कंप्यूटिंग शक्ति के साथ शैक्षणिक प्रयोगशाला ⚠️ स्वयं लागू करने की आवश्यकता है, कोई आधिकारिक कोड नहीं 32× एच100 जीपीयू
GPDiT-H को पुन: प्रस्तुत करें बड़ी शोध टीम ⚠️ स्वयं लागू करने की आवश्यकता है, कोई आधिकारिक कोड नहीं 64+ एच100 जीपीयू, मल्टी-स्टेज ट्रेनिंग
कुछ नमूना फाइन-ट्यूनिंग प्रयोग पूर्व-प्रशिक्षित भार वाली टीम ❌ मॉडल वजन का खुलासा नहीं किया गया है सिंगल-कार्ड जीपीयू
वाणिज्यिक एकीकरण एंटरप्राइज़ उपयोगकर्ता ❌ कोड/मॉडल खुला स्रोत नहीं है एन/ए

उपयोग सुझाव: जो टीमें इस दिशा का पालन करना चाहती हैं, उन्हें पहले पेपर के आर्किटेक्चरल डिज़ाइन (§4) और एब्लेशन प्रयोगों (§5) को ध्यान से पढ़ने की सलाह दी जाती है, जिसमें हल्के कारण ध्यान के कार्यान्वयन विवरण और रोटेशन टाइम एन्कोडिंग की गणितीय व्युत्पत्ति पर ध्यान केंद्रित किया जाता है। यदि टीम का पुनरुत्पादन करने का इरादा है, तो वह GPDiT-B से शुरू कर सकती है, UCF-101 (पेपर रिपोर्ट 214-216) पर बुनियादी FVD संकेतकों को सत्यापित कर सकती है, और फिर तय कर सकती है कि GPDiT-H तक विस्तार किया जाए या नहीं।

उत्पाद का मूल्य निर्धारण

GPDiT एक अकादमिक अनुसंधान परियोजना है और इसमें कोई व्यावसायिक उत्पाद मूल्य निर्धारण प्रणाली नहीं है। निम्नलिखित विभिन्न रूपों की लागतों का अवलोकन है:

प्रोजेक्ट विवरण
पेपर एक्सेस arXiv स्थायी रूप से मुफ़्त है और PDF/HTML/TeX डाउनलोड का समर्थन करता है
कोड और मॉडल खुला स्रोत नहीं, मूल्य निर्धारण की कोई जानकारी नहीं
एपीआई सेवा प्रदान नहीं किया गया
वाणिज्यिक लाइसेंस अप्रकाशित (लेखक टीम या संस्थागत प्रौद्योगिकी हस्तांतरण कार्यालय से संपर्क करने की आवश्यकता है)
स्व-प्रशिक्षण कंप्यूटिंग शक्ति लागत (कटौती) GPDiT-B लगभग $10K-20K (32× H100, 2-3 दिन) है; GPDiT-H लगभग $50K-100K+ (64+ H100, 1-2 सप्ताह) है

वाणिज्यिक वीडियो निर्माण समाधानों के साथ लागत की तुलना:

योजना विशिष्ट मासिक लागत लागू परिदृश्य उत्पादन गुणवत्ता
GPDiT (स्व-प्रशिक्षण, कटौती) $10K-100K (एक बार) अकादमिक अनुसंधान, वास्तुकला अन्वेषण स्व-रिपोर्टेड पेपर एमएसआरवीटीटी एफवीडी 64
रनवे जेन-3 $0.05-0.10/सेकंड सामग्री निर्माण, विज्ञापन उत्पादन व्यावसायिक-ग्रेड छवि गुणवत्ता और स्थिरता
पिका सदस्यता $10-50/माह व्यक्तिगत निर्माता, सोशल मीडिया वीडियो त्वरित उत्पादन, मध्यम नियंत्रण
स्थिर वीडियो प्रसार (खुला स्रोत) स्व-होस्टेड जीपीयू लागत स्व-तैनाती परिदृश्य मुक्त स्रोत समुदाय द्वारा निरंतर अनुकूलन

वर्तमान चरण में GPDiT का लागत प्रदर्शन वाणिज्यिक समाधानों की तुलना में बहुत कम है। इसका मूल्य प्रस्ताव "मौजूदा वीडियो जेनरेशन टूल को बदलना" नहीं है, बल्कि अगली पीढ़ी की वास्तुकला के लिए तकनीकी सत्यापन और अकादमिक संदर्भ प्रदान करना है।

अनुप्रयोग परिदृश्य

GPDiT की तकनीकी विशेषताएं यह निर्धारित करती हैं कि यह उपयोग के लिए तैयार उत्पादन वातावरण के बजाय अनुसंधान और इंजीनियरिंग अन्वेषण परिदृश्यों के लिए अधिक उपयुक्त है:

  • ऑटोरेग्रेसिव डिफ्यूजन फ्यूजन आर्किटेक्चर पर शोध: GPDiT एक पूर्ण फ्रेम-स्तरीय ऑटोरेग्रेसिव डिफ्यूजन फ्रेमवर्क प्रदान करता है, जिस पर शोधकर्ता नए ध्यान वेरिएंट, टेम्पोरल कंडीशनिंग तंत्र या मल्टी-मोडल एक्सटेंशन का पता लगा सकते हैं। इसका हल्का आर्किटेक्चर एब्लेशन प्रयोगों के लिए विशेष रूप से उपयुक्त है - 85M पैरामीटर GPDiT-B नए विचारों के तेजी से पुनरावृत्त सत्यापन की अनुमति देता है।

  • लंबे अनुक्रम वीडियो निर्माण पर शोध: GPDiT का कारणात्मक ध्यान और KV कैश समर्थन लंबे अनुक्रम उत्पादन की कम्प्यूटेशनल लागत को नियंत्रित करने योग्य बनाता है। पेपर 17-45 फ्रेम रेंज में GPDiT-H-LONG की स्थिरता की पुष्टि करता है। अनुसंधान कार्यों के लिए जिनके लिए दसियों सेकंड के निरंतर वीडियो (जैसे स्वायत्त ड्राइविंग दृश्य भविष्यवाणी, गति सिमुलेशन) की आवश्यकता होती है, GPDiT की वास्तुकला निश्चित-लंबाई प्रसार मॉडल की तुलना में अधिक प्राकृतिक समाधान प्रदान करती है।

  • एकीकृत पीढ़ी-समझ मॉडल अन्वेषण: GPDiT के प्रयोगों से पता चलता है कि पीढ़ी की गुणवत्ता और प्रतिनिधित्व क्षमता के बीच एक सकारात्मक संबंध है, जिसका अर्थ है कि "एक मॉडल पीढ़ी और समझ दोनों कर रहा है" का मार्ग संभव है। उन टीमों के लिए जो विज़ुअल फ़ाउंडेशन मॉडल बनाना चाहती हैं, GPDiT पीढ़ी की ओर से एक एकीकृत प्रशिक्षण प्रतिमान संदर्भ प्रदान करता है।

  • कम-नमूना वीडियो कार्य अनुकूलन: विशिष्ट क्षेत्रों (जैसे चिकित्सा छवि रूपांतरण, औद्योगिक निरीक्षण विज़ुअलाइज़ेशन) के लिए, GPDiT की कुछ-नमूना माइग्रेशन क्षमता का मतलब है कि इसे बहुत कम मात्रा में एनोटेटेड डेटा के साथ जल्दी से अनुकूलित किया जा सकता है। 20 शॉट्स + 500 पुनरावृत्तियों की सीमा एक समर्पित मॉडल को शुरू से प्रशिक्षित करने की तुलना में बहुत कम है।

परिदृश्यों के लिए उपयुक्त नहीं:

  • उपयोग के लिए तैयार वीडियो सामग्री उत्पादन: कोई कोड नहीं, कोई मॉडल नहीं, कोई डेमो नहीं, GPDiT वर्तमान में सामग्री निर्माताओं के लिए पूरी तरह से अनुपलब्ध है।
  • वास्तविक समय इंटरैक्टिव पीढ़ी: प्रसार मॉडल की पुनरावृत्त निरूपण प्रक्रिया स्वाभाविक रूप से वास्तविक समय परिदृश्यों के लिए उपयुक्त नहीं है, और पेपर में वास्तविक समय में GPDiT की अनुमान दक्षता का मूल्यांकन नहीं किया जाता है।
  • औद्योगिक-ग्रेड वीडियो पीढ़ी जिसके लिए उच्च-परिशुद्धता समय नियंत्रण की आवश्यकता होती है: एक अकादमिक पेपर-स्तरीय मॉडल के रूप में, GPDiT के पास नियंत्रणीयता और स्थिरता के मामले में इंजीनियरिंग-स्तर की गारंटी नहीं है।

लागू लोग

  • वीडियो निर्माण के क्षेत्र में शोधकर्ता: जो शोधकर्ता प्रसार मॉडल और ऑटोरेग्रेसिव मॉडल के क्रॉस-फ़्यूज़न के बारे में चिंतित हैं, वे विस्तार या तुलना के लिए आधारभूत ढांचे के रूप में GPDiT का उपयोग कर सकते हैं। विभिन्न कार्यों पर OF और OF2 ध्यान वेरिएंट के बीच प्रदर्शन अंतर को समझने के लिए पेपर के एब्लेशन प्रयोग (§5.2-5.4) से शुरुआत करने की अनुशंसा की जाती है।

  • कंप्यूटर विजन एल्गोरिथम इंजीनियर: इंजीनियर जो वीडियो निर्माण की अत्याधुनिक तकनीक को ट्रैक करना चाहते हैं, जो पेपर के तकनीकी समाधान (§4) के गहन पढ़ने के लिए उपयुक्त है, हल्के कारण ध्यान के कार्यान्वयन पथ पर ध्यान केंद्रित करते हैं - इस डिजाइन की तर्क दक्षता में लाभ इंजीनियरिंग कार्यान्वयन मूल्य है।

  • मल्टीमॉडल बेसिक मॉडल टीम: एक टीम जो पीढ़ी और समझ के एकीकरण की खोज कर रही है। GPDiT का यह निष्कर्ष कि "पीढ़ी क्षमता और प्रतिनिधित्व क्षमता सकारात्मक रूप से संबंधित हैं" (चित्र 5c) आगे के अध्ययन के योग्य है। आप अपने स्वयं के ढांचे में सत्यापित कर सकते हैं कि क्या यह घटना अन्य आर्किटेक्चर में पुन: प्रस्तुत की गई है।

  • शैक्षणिक प्रयोगशालाएँ (मास्टर और डॉक्टरेट छात्रों सहित): GPDiT-B का 85M पैरामीटर स्केल छात्र प्रयोगशालाओं के लिए अपेक्षाकृत अनुकूल है। यदि टीम के पास 4-8 जीपीयू हैं, तो वह प्रसार ट्रांसफार्मर की दिशा में एक शिक्षण परियोजना के रूप में यूसीएफ-101 पर मुख्य प्रयोग को पुन: पेश करने का प्रयास कर सकती है।

भीड़ को मना करें:

  • सामग्री निर्माता/स्व-मीडिया ऑपरेटर: GPDiT के पास वर्तमान में कोई प्रवेश द्वार उपलब्ध नहीं है। रनवे, पिका या क्लिंग जैसे व्यावसायिक उपकरणों की ओर रुख करने की अनुशंसा की जाती है।
  • उत्पाद टीमें जिन्हें 1-2 सप्ताह के भीतर वीडियो निर्माण कार्यक्षमता प्रदान करने की आवश्यकता होती है: GPDiT की वापसी अवधि महीनों में मापी जाती है।
  • गहन शिक्षण पृष्ठभूमि के बिना तकनीकी निर्णय लेने वाले: GPDiT के मूल्यांकन के लिए प्रसार मॉडल और ऑटोरेग्रेसिव मॉडल के अंतर्निहित सिद्धांतों को समझने की आवश्यकता होती है, और यह खरीद मूल्यांकन के लिए उपयुक्त नहीं है।

सारांश और आउटलुक

GPDiT ने तकनीकी रोडमैप पर एक सार्थक योगदान दिया है - निरंतर अव्यक्त स्थान में फ्रेम-स्तरीय ऑटोरेग्रेसिव भविष्यवाणी और प्रसार पीढ़ी को एकीकृत करना, और हल्के कारण ध्यान और घूर्णी समय एन्कोडिंग के दो व्यावहारिक अनुकूलन का प्रस्ताव करना। MSRVTT और UCF-101 पर, GPDiT-H उस समय इष्टतम या निकट-इष्टतम स्तर पर पहुंच गया, और GPDiT-B ने 85M मापदंडों के साथ बड़े मॉडल के साथ प्रतिस्पर्धी परिणाम हासिल किए, जो वास्तुशिल्प डिजाइन की दक्षता लाभ को साबित करता है।

पेपर के चर्चा अनुभाग से यह देखा जा सकता है कि लेखक टीम को वर्तमान कार्य की सीमाओं का एहसास हुआ है: प्रायोगिक पैमाना कंप्यूटिंग शक्ति द्वारा सीमित है, मॉडल वीडियो मोडैलिटी तक सीमित है, और भाषा जैसे मल्टी-मोडल एक्सटेंशन का अभी तक पता नहीं लगाया जा सका है। एक्टिविटीनेट-क्यूए पर पेपर की 28.2% की वीक्यूए सटीकता (वीडियो-चैटजीपीटी पर 35.2% की तुलना में) यह भी दर्शाती है कि GPDiT की प्रतिनिधित्व सीखने की क्षमताओं में अभी भी सुधार की गुंजाइश है।

अनुवर्ती अवलोकन बिंदु:

  1. कोड ओपन सोर्स: GPDiT का पूर्ण पुनरुत्पादन आधिकारिक कोड रिलीज़ पर निर्भर करता है। यदि पेपर सीवीपीआर/आईसीसीवी जैसे शीर्ष सम्मेलनों द्वारा स्वीकार किया जाता है, तो कोड के ओपन सोर्स होने की संभावना काफी बढ़ जाएगी। यूएसटीसी या स्टेपफन के GitHub खातों का अनुसरण करने की अनुशंसा की जाती है।
  2. बड़ी स्केलिंग: 2025 में बड़े मॉडलों के संदर्भ में पेपर 2बी मापदंडों का प्रयोगात्मक पैमाना मध्यम है। यदि बाद में इसे 7बी-13बी मापदंडों तक विस्तारित किया जाए, तो वास्तुशिल्प लाभ अधिक स्पष्ट हो सकते हैं।
  3. मल्टीमॉडल एक्सटेंशन: GPDiT के लेखक स्पष्ट रूप से भाषा जैसे मल्टीमॉडल इनपुट के एकीकृत मॉडलिंग का पता लगाने की योजना बना रहे हैं। यह निर्धारित करेगा कि क्या यह "वीडियो जेनरेशन मॉडल" से "विज़ुअल बेसिक मॉडल" तक विकसित हो सकता है।
  4. स्टेप-वीडियो श्रृंखला के साथ सहयोग: स्टेप स्टार स्टेप-वीडियो-T2V और स्टेप-वीडियो-TI2V दोनों का प्रकाशक है, और GPDiT के प्रौद्योगिकी संचय को स्टेप-वीडियो की उत्पाद लाइन में एकीकृत किया जा सकता है।

खरीद/गोद लेने का जोखिम मूल्यांकन: GPDiT इस स्तर पर खरीद लक्ष्य या उत्पाद एकीकरण निर्भरता के रूप में उपयुक्त नहीं है। शैक्षणिक टीमें इसे एक महत्वपूर्ण संदर्भ के रूप में अनुसंधान आधार रेखा में शामिल कर सकती हैं; औद्योगिक टीमें प्रौद्योगिकी अपनाने का मूल्यांकन करने से पहले कोड के ओपन सोर्स होने और समुदाय द्वारा सत्यापित होने की प्रतीक्षा करने की सलाह देती हैं। जीपीडीआईटी पर आधारित किसी भी व्यावसायीकरण योजना को पहले यूएसटीसी और स्टेपफन की बौद्धिक संपदा सीमाओं की पुष्टि करने के लिए एक एफटीओ विश्लेषण पूरा करना होगा। यदि टीम का लक्ष्य केवल "2026 में उच्च-गुणवत्ता वाली वीडियो पीढ़ी का उपयोग करना" है, तो वाणिज्यिक एपीआई (रनवे, पिका, क्लिंग, सोरा) या परिपक्व प्रसार ओपन सोर्स समाधान (स्थिर वीडियो डिफ्यूजन, वीडियोक्राफ्टर) के मूल्यांकन को प्राथमिकता देने और अगली पीढ़ी के आर्किटेक्चर के लिए तकनीकी रिजर्व के रूप में GPDiT का उपयोग करने की सिफारिश की जाती है।

संबंधित उपकरण: runway, pika

संस्करण जानकारी

  • GPDiT-H-लंबा :arXiv v5 अपडेट, GPDiT-H-LONG वेरिएंट का प्रस्ताव करता है, 17-45 फ्रेम वेरिएबल लंबाई वीडियो पीढ़ी का समर्थन करता है, और MSRVTT पर FVD को घटाकर 64 कर दिया गया है।
  • GPDiT प्रथम संस्करण :arXiv में पहला सबमिशन दो विशिष्टताओं का प्रस्ताव करता है: ऑटोरेग्रेसिव डिफ्यूजन ट्रांसफार्मर इंफ्रास्ट्रक्चर और GPDiT-B/GPDiT-H।
  • GPDiT-H अद्यतन :वीडियो निर्माण और प्रतिनिधित्व सीखने में GPDiT-H के मूल्यांकन में सुधार के लिए प्रायोगिक डेटा और एब्लेशन अध्ययन को पूरक करें।
  • GPDiT-H-लंबा :GPDiT-H-LONG वैरिएंट और लंबा वीडियो जेनरेशन मूल्यांकन जोड़ा गया, अंतिम संस्करण जारी किया गया। अभी तक कोई आधिकारिक सटीक तारीख नहीं है।

उपयोगकर्ता समीक्षाएं

  • समीक्षाएं लोड हो रही हैं...