डीपइन्फ्रा
डीपइन्फ्रा एक
डीपइन्फ्रा
मुख्य पैरामीटर और आँकड़े
डीपइन्फ्रा को एआई अनुमान क्लाउड इंफ्रास्ट्रक्चर के रूप में तैनात किया गया है, जो डेवलपर्स और उद्यमों को ओपनएआई-संगत अनुमान एपीआई प्रदान करता है। यह एक एकल मॉडल नहीं है, बल्कि एक मॉडल होस्टिंग और अनुमान सेवा प्लेटफ़ॉर्म है, जो टेक्स्ट जेनरेशन, विज़ुअल अंडरस्टैंडिंग, इमेज जेनरेशन, स्पीच रिकग्निशन, एम्बेडिंग और रीऑर्डरिंग जैसी कई क्षमताओं को कवर करता है।
| प्रोजेक्ट्स | सार्वजनिक सूचना |
|---|---|
| आधिकारिक स्थिति | एआई अनुमान क्लाउड - ओपनएआई-संगत एपीआई, 100 ओपन-सोर्स मॉडल |
| प्लेटफार्म फॉर्म | अनुमान एपीआई, निजी मॉडल परिनियोजन, जीपीयू क्लस्टर किराये |
| मॉडल स्केल | 100+ ओपन सोर्स मॉडल (एलएलएम, मल्टी-मोडल, इमेज, स्पीच, एम्बेडिंग) |
| एपीआई संगत | OpenAI SDK संगत (base_url को बदला और उपयोग किया जा सकता है) |
| सेवा स्तर | मानक (1x), प्राथमिकता (1.5x), फ्लेक्स (0.8x) |
| समवर्ती ऊपरी सीमा | डिफ़ॉल्ट 200 समवर्ती अनुरोध/खाता (सुधार के लिए आवेदन कर सकते हैं) |
| प्रथम टोकन विलंबता (TTFT) | अघोषित सामान्य डेटा; प्राथमिकता स्तर मानक से काफी कम है, विवरण मॉडल और लोड के आधार पर भिन्न होता है, और वास्तविक परीक्षण के अधीन है |
| टोकन थ्रूपुट (टीपीएम/आरपीएम) | सामान्य आवृत्ति नियंत्रण मूल्य का खुलासा नहीं किया गया है; प्लेटफ़ॉर्म को टोकन द्वारा बिल किया जाता है और कोई कठोर दर सीमा नहीं है, लेकिन 200 समवर्ती सीमा अप्रत्यक्ष रूप से थ्रूपुट को प्रतिबंधित करती है |
| अनुपालन प्रमाणन | एसओसी 2, आईएसओ 27001 |
| डाटा सेंटर | संयुक्त राज्य अमेरिका में 8 स्व-निर्मित डेटा केंद्र |
| डेटा रणनीति | शून्य प्रतिधारण |
| कंपनी की स्थापना | सितम्बर 2022 |
| संचयी वित्तपोषण | यूएस$107 मिलियन सीरीज़ बी (2026-05) |
| समर्थन मंच | वेब डैशबोर्ड, रेस्ट एपीआई |
सेवा स्तर तंत्र: डीपइन्फ्रा के तीन सेवा स्तर अनुरोध शेड्यूलिंग प्राथमिकता द्वारा प्रतिष्ठित हैं। मानक डिफ़ॉल्ट शेड्यूलिंग है, तेजी से पहले टोकन विलंबता (कीमत 1.5 गुना) प्राप्त करने के लिए मानक ट्रैफ़िक से पहले प्राथमिकता कतार अनुरोध करता है, और फ्लेक्स धीमी प्रतिक्रिया और कभी-कभी अनुपलब्धता (कीमत 0.8 गुना) के बदले में कम कीमत प्रदान करता है, जो गैर-उत्पादन या अतुल्यकालिक परिदृश्यों के लिए उपयुक्त है।
कवर्ड मॉडल श्रेणियां: प्लेटफ़ॉर्म एक साथ कई प्रकार के मॉडल होस्ट करता है जैसे टेक्स्ट जेनरेशन, विज़न/ओसीआर, एम्बेडिंग/रीऑर्डरिंग, इमेज जेनरेशन (फ्लक्स सीरीज़), स्पीच रिकग्निशन (व्हिस्पर/वोक्सट्राल), वीडियो जेनरेशन, आदि। इन सभी को एक एपीआई कुंजी के साथ कॉल किया जा सकता है।
उपयोगकर्ता और बाज़ार की पहचान
डीपइन्फ्रा की बाजार पहचान मुख्य रूप से तीन स्तरों पर परिलक्षित होती है: डेवलपर पारिस्थितिकी तंत्र, कॉर्पोरेट ग्राहक और पूंजी बाजार:
डेवलपर एडॉप्शन: डीपइन्फ्रा ओपनराउटर पर सबसे बड़ी संख्या में होस्ट किए गए मॉडल के साथ अनुमान प्रदाता है। प्लेटफ़ॉर्म OpenAI संगत API प्रदान करता है। डेवलपर्स को शून्य कोड परिवर्तन के साथ माइग्रेट करने के लिए केवल base_url को https://api.depinfra.com/v1/openai पर इंगित करने की आवश्यकता है। GitHub संगठन में 47 रिपॉजिटरी हैं, जिनमें आधिकारिक टाइपस्क्रिप्ट/नोड एसडीके, पायथन एसडीके (सामुदायिक रखरखाव), लैंगचेन एकीकृत सीएलआई टूल 'डीपसीटीएल' और कुकबुक उदाहरणों की एक समृद्ध लाइब्रेरी शामिल है।
एंटरप्राइज़ ग्राहक: आधिकारिक वेबसाइट सार्वजनिक रूप से OpenRouter, Quora, Vercel, Adobe, Ubisoft, Meta, ByteDance, LinkedIn, Microsoft, Deloitte, Salesforce, Hugging Face, Rakuten इत्यादि सहित प्रौद्योगिकी, परामर्श, वित्त, खेल और अन्य क्षेत्रों को कवर करने वाले प्रसिद्ध उपयोगकर्ताओं को प्रदर्शित करती है। ये ग्राहक अपने एआई उत्पादों के लिए बिजली उत्पादन अनुमान वर्कलोड के लिए डीपइन्फ्रा का उपयोग करते हैं।
पूंजी बाजार: मई 2026 में 500 ग्लोबल और जॉर्जेस हारिक (imo.im के सह-संस्थापक) के सह-नेतृत्व में, NVIDIA, सैमसंग नेक्स्ट, सुपरमाइक्रो, फेलिसिस, क्रिसेंट कोव, ए.कैपिटल वेंचर्स, पीक6, अपर90 आदि की भागीदारी के साथ $107 मिलियन सीरीज बी वित्तपोषण पूरा किया गया। सीरीज ए के बाद से टोकन प्रसंस्करण की मात्रा 25 गुना बढ़ गई है।
उद्योग मान्यता: नेमोट्रॉन मॉडल नेमोक्लॉ एजेंट फ्रेमवर्क और एनवीआईडीआईए डायनमो इंट्रेंस सॉफ्टवेयर का समर्थन करने के लिए एनवीआईडीआईए के साथ प्रारंभिक बुनियादी ढांचा सहयोग स्थापित करना, और ब्लैकवेल जीपीयू को तैनात करने वाला पहला होना।
लागत लाभ
डीपइन्फ्रा की लागत संरचना "केवल आपके द्वारा वास्तव में उपयोग की जाने वाली कंप्यूटिंग के लिए भुगतान करें" के आसपास डिज़ाइन की गई है, जिसमें कोई न्यूनतम या दीर्घकालिक अनुबंध नहीं है।
सी-साइड/व्यक्तिगत: डीपइन्फ्रा सी-साइड के लिए सीधे चैट उत्पाद प्रदान नहीं करता है (इसका स्वतंत्र उत्पाद डीपजीपीटी इस मांग को पूरा कर सकता है)। व्यक्तिगत डेवलपर्स इसका उपयोग एपीआई के माध्यम से करते हैं, टोकन या निष्पादन समय के आधार पर बिल किया जाता है, और कोई मासिक शुल्क सीमा नहीं है। एंबेड मॉडल $0.005/मिलियन टोकन से शुरू होते हैं।
एपीआई/डेवलपर: एलएलएम को इनपुट/आउटपुट टोकन द्वारा अलग से बिल किया जाता है, और कैश हिट छूट का समर्थन करता है (उदाहरण के लिए, डीपसीक वी4-प्रो कैश इनपुट केवल $0.10/मिलियन टोकन है, जो मानक इनपुट $1.30 से बहुत कम है)। छवि मॉडल को उत्पन्न रिज़ॉल्यूशन और पुनरावृत्तियों की संख्या के आधार पर चार्ज किया जाता है (उदाहरण के लिए FLUX-2-dev $0.01 × (w/1024) × (h/1024) × (iters/28))। भाषण मॉडल का निष्पादन समय के आधार पर बिल किया जाता है। एक उदाहरण के रूप में डीपसीक वी4-फ्लैश को लेते हुए, इनपुट $0.09/मिलियन टोकन है और आउटपुट $0.18/मिलियन टोकन है, जो ओपन सोर्स मॉडल अनुमान बाजार में एक बहुत ही प्रतिस्पर्धी मूल्य है।
| मॉडल उदाहरण | प्रसंग | इनपुट मूल्य ($/M टोकन) | आउटपुट मूल्य ($/M टोकन) |
|---|---|---|---|
| डीपसीक-वी4-फ्लैश | 1024k | $0.09 ($0.018 कैश्ड) | $0.18 |
| डीपसीक-वी4-प्रो | 1024k | $1.30 ($0.10 कैश) | $2.60 |
| Qwen3.6-35B-A3B | 256k | $0.15 | $0.95 |
| लामा-4-मेवरिक-17बी-128ई | 1024k | $0.20 | $0.80 |
| जेम्मा-4-26बी-ए4बी-इट | 256k | $0.07 | $0.34 |
| मिस्ट्रल-स्मॉल-3.2-24बी | 125k | $0.075 | $0.20 |
उद्यम/निजीकरण: दो निजीकरण मोड का समर्थन करता है। पहला कस्टम एलएलएम परिनियोजन (कस्टम एलएलएम) है, जो समर्पित जीपीयू पर अपने स्वयं के मॉडल चलाता है और जीपीयू घंटों के अनुसार बिल किया जाता है: ए100 $0.89/घंटा, एच100 $2.20/घंटा, एच200 $2.69/घंटा, बी200 $3.69/घंटा, बी300 $4.89/घंटा, मिनट के स्तर पर बिल किया जाता है, और साप्ताहिक आधार पर बिल किया जाता है। दूसरा डीपक्लस्टर एक्सक्लूसिव क्लस्टर है। 5-वर्षीय बी300 क्लस्टर केवल $1.98/जीपीयू-एच (सार्वजनिक क्लाउड $6.50/जीपीयू-एच की तुलना में) है, लगभग 70% की छूट। 256-5000 जीपीयू उपलब्ध हैं, जिसमें टियर 3 डेटा सेंटर और 99.982% उपलब्धता एसएलए शामिल है।
छिपी हुई लागत: एपीआई मॉडल की छिपी हुई लागतों में मुख्य रूप से उच्च-आवृत्ति कॉल (डिफ़ॉल्ट 200 समवर्ती) के दौरान समवर्ती सीमा, इससे अधिक होने के बाद कोटा बढ़ाने के लिए व्यवसाय से संपर्क करने की संचार लागत और प्राथमिकता स्तर पर कीमत में 1.5 गुना वृद्धि शामिल है। उद्यम निजीकरण परिनियोजन के लिए कंप्यूटर कक्ष स्थान, बिजली और नेटवर्क बैंडविड्थ में सहायक निवेश का मूल्यांकन करने की भी आवश्यकता है।
मुख्य कार्य
डीपइन्फ्रा की क्षमताओं को "सभी मॉडलों को कॉल करने के लिए एक एपीआई" के आसपास डिज़ाइन किया गया है। मुख्य कार्यों में शामिल हैं:
-
ओपनएआई कम्पेटिबल रीजनिंग एपीआई: टेक्स्ट जेनरेशन, मल्टी-मोडल समझ, एम्बेडिंग और 100+ ओपन सोर्स मॉडल के रीऑर्डरिंग का समर्थन करता है। OpenAI SDK या किसी संगत क्लाइंट का उपयोग करके, कॉल करने के लिए बस
base_urlऔरapi_keyको संशोधित करें। स्ट्रीमिंग आउटपुट JSON स्कीमा, टूल कॉलिंग/फ़ंक्शन कॉलिंग, संदर्भ कैशिंग और अन्य सुविधाओं का समर्थन करता है। -
मल्टी-मोडल और विज़ुअल समझ: छवि समझ, ओसीआर टेक्स्ट निष्कर्षण और जेम्मा 4, क्वेन-वीएल और किमी के2.6 जैसे मल्टी-मोडल मॉडल के दस्तावेज़ विश्लेषण का समर्थन करता है। बस मानक चैट समापन एपीआई के माध्यम से छवि यूआरएल या बेस 64 में पास करें।
-
इमेज और वीडियो जेनरेशन: FLUX (FLUX-2-dev, FLUX-2-pro, FLUX-2-max, आदि), इमेज जेनरेशन मॉडल जैसे स्टेबल डिफ्यूजन और टेक्स्ट-टू-वीडियो मॉडल की पूरी श्रृंखला होस्ट करता है। बिलिंग उच्च लचीलेपन के साथ रिज़ॉल्यूशन और पुनरावृत्तियों की संख्या पर आधारित है।
-
एम्बेडिंग और रीरैंकिंग: बीजीई, ई5, जीटीई और बहुभाषी-ई5 जैसे मुख्यधारा के एम्बेडिंग मॉडल, साथ ही रीरैंकिंग क्षमताएं प्रदान करता है, जो आरएजी, सिमेंटिक खोज और सूचना पुनर्प्राप्ति परिदृश्यों के लिए उपयुक्त है। न्यूनतम $0.005/मिलियन टोकन।
-
वाक् पहचान और संश्लेषण: ओपनएआई व्हिस्पर श्रृंखला मॉडल और वोक्सट्रल श्रृंखला वाक् मॉडल का समर्थन करता है, जो वाक्-से-पाठ और पाठ-से-वाक् परिदृश्यों को कवर करता है।
-
निजी मॉडल परिनियोजन (कस्टम एलएलएम): स्वचालित विस्तार और संकुचन और निजी समापन बिंदु अलगाव के साथ, डीपइन्फ्रा के A100/H100/H200/B200/B300 GPU पर अपना खुद का फाइन-ट्यून मॉडल तैनात करें। उच्च डेटा संप्रभुता आवश्यकताओं या अनुकूलित तर्क तर्क वाली टीमों के लिए उपयुक्त।
-
जीपीयू क्लस्टर रेंटल (डीपक्लस्टर): सीधे एसएसएच कनेक्शन के साथ 5 साल के दीर्घकालिक अनुबंध के रूप में बी300 एक्सक्लूसिव क्लस्टर प्रदान करता है, जो प्रशिक्षण, फाइन-ट्यूनिंग या अन्य परिदृश्यों के लिए उपयुक्त है, जिनके लिए निरंतर जीपीयू कंप्यूटिंग शक्ति की आवश्यकता होती है।
कार्यात्मक तालमेल: डीपइन्फ्रा की वास्तविक उत्पाद शक्ति किसी एक फ़ंक्शन में नहीं, बल्कि "एकल एपीआई प्रविष्टि + एकाधिक मॉडल प्रकार + सेवा स्तरों की लचीली स्विचिंग" के संयोजन में निहित है। विकास टीम को छवि निर्माण, पाठ तर्क और एम्बेडेड पुनर्प्राप्ति के लिए विभिन्न आपूर्तिकर्ताओं से जुड़ने की आवश्यकता नहीं है। एक एकीकरण कई AI लोड को कवर कर सकता है। निजी मॉडल और जीपीयू क्लस्टर का ओवरले उद्यमों को प्रयोग से लेकर उत्पादन तक और अनुमान से लेकर प्रशिक्षण तक पूरे एआई वर्कलोड पैकेज को एक ही मंच पर पूरा करने की अनुमति देता है।
मॉडल और संस्करण विकास
निरंतर पुनरावृत्त अद्यतन, नवीनतम संस्करण प्रदर्शन अनुकूलन और नई सुविधाएँ पेश करता है। ऐतिहासिक संस्करण की जानकारी आधिकारिक रिलीज़ पृष्ठ पर देखी जा सकती है। अभी तक कोई पूर्ण सार्वजनिक संस्करण विकास समयरेखा नहीं है। फीचर अपडेट की लय को समझने के लिए आधिकारिक घोषणा पर ध्यान देने की सिफारिश की जाती है।
तकनीकी लाभ
डीपइन्फ्रा की तकनीकी प्रतिस्पर्धात्मकता "ऊर्ध्वाधर एकीकरण + अनुमान अनुकूलन" की सिस्टम-स्तरीय इंजीनियरिंग क्षमताओं से आती है। प्रत्येक क्षमता "यह तेज़/अधिक किफायती/अधिक स्थिर क्यों है" की कारण श्रृंखला के इर्द-गिर्द घूमती है:
स्वयं का बुनियादी ढांचा -> मध्य स्तरीय मूल्य वृद्धि और संसाधन प्रतिस्पर्धा को खत्म करें: सार्वजनिक क्लाउड (एडब्ल्यूएस/जीसीपी/एज़्योर) पर अनुमान परतें बनाने वाले प्रतिस्पर्धी उत्पादों के विपरीत, डीपइंफ्रा स्वयं खरीदता है और संयुक्त राज्य अमेरिका में 8 डेटा केंद्रों में जीपीयू हार्डवेयर संचालित करता है, जिसमें चिप्स से लेकर एपीआई तक फुल-स्टैक ऑटो-कंट्रोल होता है। यह आर्किटेक्चर तीन स्तरों पर संरचनात्मक लाभ पैदा करता है - लागत के संदर्भ में, यह क्लाउड विक्रेताओं की मार्कअप परत को समाप्त करता है (उदाहरण के तौर पर डीपक्लस्टर बी300 को लें, सार्वजनिक क्लाउड $6.50/जीपीयू-घंटा की तुलना में $1.98/जीपीयू-घंटा); विलंबता के संदर्भ में, यह भौतिक मशीनों की ओवरबुकिंग के कारण होने वाले उतार-चढ़ाव से बचाता है; क्षमता के संदर्भ में, यह क्लाउड विक्रेता कोटा द्वारा प्रतिबंधित किए बिना नए मॉडल के जारी होने के बाद बड़े पैमाने पर तैनाती को जल्दी से पूरा कर सकता है। लागू परिदृश्य: उच्च-थ्रूपुट, लगातार चलने वाले एजेंट अनुमान और उत्पादन-स्तरीय एलएलएम सेवाएं।
अनुमान अनुकूलन सॉफ्टवेयर स्टैक -> उच्च GPU उपयोग और प्रति टोकन कम लागत: टीम NVIDIA TensorRT-LLM और vLLM (दोनों के GitHub पर आधिकारिक फोर्क हैं) के इंजीनियरिंग विकास में गहराई से शामिल है, और NVIDIA डायनेमो वितरित अनुमान ढांचे के साथ संयुक्त अनुकूलन भी है। इसका मतलब यह है कि डीपइंफ्रा ऑपरेटर स्तर (फ्लैशअटेंशन, पेजेडअटेंशन, कंटीन्यूअस बैचिंग) और शेड्यूलिंग स्तर (केवी कैश मैनेजमेंट, डायनेमिक बैच प्रोसेसिंग) पर सामान्य क्लाउड प्लेटफॉर्म की तुलना में उच्च जीपीयू उपयोग प्राप्त कर सकता है। उपयोग दर जितनी अधिक होगी, प्रति मिलियन टोकन पर निश्चित लागत परिशोधन उतना ही कम होगा, जो अंततः टर्मिनल मूल्य लाभ में परिलक्षित होता है। लागू परिदृश्य: बड़े पैमाने पर अनुमान परिदृश्य जो टोकन इकाई मूल्य के प्रति संवेदनशील हैं।
एनवीडिया इकोसिस्टम गहन सहयोग -> अगली पीढ़ी के हार्डवेयर लाभांश प्राप्त करने वाले पहले व्यक्ति बनें: एनवीडिया के ओपन एआई इकोसिस्टम के शुरुआती बुनियादी ढांचे के भागीदार के रूप में, डीपइन्फ्रा ब्लैकवेल बी200/बी300 जीपीयू को तैनात करने वाला पहला है और वेरा रुबिन आर्किटेक्चर पर डायनमो के माध्यम से अनुमान लागत दक्षता में 20 गुना सुधार हासिल करने की योजना बना रहा है। इस साझेदारी का मतलब न केवल हार्डवेयर चयन में प्राथमिकता है, बल्कि इससे भी महत्वपूर्ण बात यह है कि डीपइन्फ्रा जीए के बाद निष्क्रिय रूप से अनुसरण करने के बजाय, एनवीआईडीआईए के अगली पीढ़ी के अनुमान सॉफ्टवेयर स्टैक (जैसे डायनेमो, नेमोक्लाव) का अनुकूलन और अनुकूलन कर सकता है, जबकि यह अभी भी विकास चरण में है। लागू परिदृश्य: ऐसे उद्यम जिन्हें दीर्घकालिक लागत अनुकूलन के लिए नवीनतम जीपीयू आर्किटेक्चर लाभांश का लाभ उठाने की आवश्यकता है।
स्वचालित विस्तार और संकुचन -> शून्य निष्क्रिय लागत: प्लेटफ़ॉर्म का अंतर्निहित स्वचालित विस्तार और संकुचन तंत्र अनुरोध लोड के आधार पर मॉडल प्रतियों की संख्या को गतिशील रूप से समायोजित करता है। प्रतिक्रिया गति सुनिश्चित करने के लिए ट्रैफ़िक चरम के दौरान स्वचालित रूप से प्रतिकृतियाँ जोड़ें, और निष्क्रिय GPU बिलिंग से बचने के लिए कम ट्रैफ़िक अवधि के दौरान प्रतिकृतियाँ जारी करें। कस्टम एलएलएम की मिनट-स्तरीय बिलिंग ग्रैन्युलैरिटी के साथ संयुक्त, उपयोगकर्ता केवल उपयोग किए गए वास्तविक जीपीयू समय के लिए भुगतान करते हैं। लागू परिदृश्य: ट्रैफ़िक पैटर्न में बड़े उतार-चढ़ाव वाले एआई अनुप्रयोग, जैसे ई-कॉमर्स प्रचार, सामाजिक विखंडन, आदि।
सेवा स्तर शेड्यूलिंग -> विभेदित संसाधन आवंटन समग्र लागत को प्रभावित नहीं करता है: मानक/प्राथमिकता/फ्लेक्स तीन-स्तरीय शेड्यूलिंग एक साधारण दर सीमा नहीं है, लेकिन अनुरोध कतार प्राथमिकता प्रबंधन के माध्यम से विभेदित संसाधन आवंटन प्राप्त करता है। प्राथमिकता 1.5x का मूल्य प्रीमियम अनुरोधों को कतार में सबसे आगे ले जाने से आता है, हार्डवेयर की कुल मात्रा में वृद्धि से नहीं। फ्लेक्स 0.8x मूल्य छूट कम लोड अवधि के दौरान शेड्यूलिंग अनुरोधों या निष्क्रिय क्षमता का उपयोग करके प्राप्त की जाती है। यह डिज़ाइन उपयोगकर्ताओं को प्लेटफ़ॉर्म की कुल लागत में उल्लेखनीय वृद्धि किए बिना लागत-विलंबित स्वतंत्र विकल्प प्रदान करता है। लागू परिदृश्य: मल्टी-लोड मिश्रित परिदृश्य (उत्पादन ट्रैफ़िक के लिए प्राथमिकता, पृष्ठभूमि बैच प्रसंस्करण के लिए फ्लेक्स)।
अनुकूलन सीमा: डीपइन्फ्रा की वास्तुशिल्प ताकत प्रशिक्षण के बजाय अनुमान में है - यह एक मॉडल पूर्व-प्रशिक्षण मंच प्रदान नहीं करता है, न ही यह सीधे एक-क्लिक फाइन-ट्यूनिंग सेवाएं प्रदान करता है (उपयोगकर्ताओं को अपने स्वयं के वजन तैयार करने और फिर उन्हें कस्टम एलएलएम के माध्यम से तैनात करने की आवश्यकता होती है)। जिन टीमों को वन-स्टॉप "प्रशिक्षण + अनुमान" सेवाओं की आवश्यकता होती है, उनके लिए बाहरी प्रशिक्षण ढांचे की आवश्यकता हो सकती है। इसके अलावा, वर्तमान डेटा सेंटर संयुक्त राज्य अमेरिका में 8 नोड्स तक सीमित है। एशिया-प्रशांत और यूरोपीय ग्राहकों के लिए, नेटवर्क विलंबता एक बाधा बन सकती है। वास्तविक तैनाती से पहले क्रॉस-क्षेत्र विलंबता परीक्षण करने की अनुशंसा की जाती है।
कैसे उपयोग करें
डीपइन्फ्रा का मुख्य उपयोग पथ एपीआई कॉलिंग है, और यह मॉडल ब्राउज़िंग, एपीआई कुंजी प्रबंधन और उपयोग निगरानी के लिए एक वेबपेज डैशबोर्ड भी प्रदान करता है।
त्वरित शुरुआत
- खाता पंजीकृत करने के लिए depinfra.com पर जाएं।
- डैशबोर्ड में एपीआई कुंजी (
https://depinfra.com/dash/api_keys) जेनरेट करें। - मॉडल को कॉल करने के लिए OpenAI SDK का उपयोग करें या सीधे HTTP अनुरोध आरंभ करें।
एपीआई कॉल उदाहरण
DeepSeek-V4-Flash को कॉल करने के लिए Python OpenAI SDK का उपयोग करें:
ओपनएआई से ओपनएआई आयात करें
क्लाइंट = ओपनएआई(
api_key='<YOUR_DEEPINFRA_API_KEY>',
बेस_यूआरएल = "https://api.depinfra.com/v1/openai",
)
प्रतिक्रिया = client.chat.completions.create(
मॉडल = "डीपसीक-एआई/डीपसीक-वी4-फ्लैश",
messages=[{"भूमिका": "उपयोगकर्ता", "सामग्री": "हैलो! डीपइन्फ्रा क्या है、"}],
तापमान=0.7,
max_tokens=1024,
धारा = सत्य,
)
प्रतिक्रिया में खंड के लिए:
प्रिंट (chunk.choices[0].delta.content या "", अंत = "")
कर्ल कॉल उदाहरण:
कर्ल -s https://api.depinfra.com/v1/openai/chat/completions \
-एच "प्राधिकरण: वाहक <आपका_DEEPINFRA_API_KEY>" \
-एच "सामग्री-प्रकार: एप्लिकेशन/जेसन" \
-डी '{
"मॉडल": "डीपसीक-एआई/डीपसीक-वी4-फ्लैश",
"संदेश": [{"भूमिका": "उपयोगकर्ता", "सामग्री": "हैलो!"}],
"तापमान": 0.7,
"max_tokens": 1024,
"धारा": सत्य
}'
सेवा स्तर सेटिंग्स
एपीआई अनुरोध में सर्विस_टियर पैरामीटर के माध्यम से शेड्यूलिंग प्राथमिकता निर्दिष्ट करें:
{
"मॉडल": "डीपसीक-एआई/डीपसीक-वी4-फ्लैश",
"संदेश": [{"भूमिका": "उपयोगकर्ता", "सामग्री": "हैलो!"}],
"सेवा_स्तर": "प्राथमिकता"
}
वैकल्पिक मान: "मानक" (डिफ़ॉल्ट, 1x मूल्य), "प्राथमिकता" (1.5x मूल्य), "फ्लेक्स" (0.8x मूल्य, गैर-उत्पादन परिदृश्य)।
| कैसे उपयोग करें | लोगों के लिए उपयुक्त | विशेषताएँ | |
|---|---|---|---|
| रेस्ट एपीआई (ओपनएआई संगत) | डेवलपर/इंटीग्रेटर | माइग्रेट करने के लिए base_url को बदलें, SDK Python, Node.js,langChain |
का समर्थन करता है |
| वेब डैशबोर्ड | मूल्यांकन/प्रयोग | मॉडल ब्राउज़ करें, एपीआई कुंजियाँ उत्पन्न करें, उपयोग और बिल देखें | |
| डीपसीटीएल सीएलआई | डेवऑप्स/एसआरई | अनुमान कार्यों और समूहों का कमांड लाइन प्रबंधन | |
| कस्टम एलएलएम | एंटरप्राइज़/मॉडल स्वामी | निजी फाइन-ट्यून मॉडल तैनात करें और स्वचालित रूप से ऊपर और नीचे स्केल करें | |
| डीपक्लस्टर | उच्च प्रदर्शन कंप्यूटिंग टीम | बी300 समर्पित क्लस्टर, एसएसएच सीधा कनेक्शन, 5 साल का अनुबंध |
उत्पाद का मूल्य निर्धारण
मूल्य निर्धारण मॉडल आधिकारिक वास्तविक समय पृष्ठ के अधीन है। आमतौर पर फ्रीमियम या सदस्यता प्रणाली का उपयोग किया जाता है, और बुनियादी कार्यों का उपयोग मुफ्त में किया जा सकता है। उन्नत कार्यों या उच्च-आवृत्ति उपयोग के लिए सशुल्क सदस्यता की आवश्यकता होती है, और उपयोगकर्ताओं को वास्तविक उपयोग के आधार पर इष्टतम समाधान का मूल्यांकन करने की सलाह दी जाती है।
अनुप्रयोग परिदृश्य
डीपइन्फ्रा के विशिष्ट कार्यान्वयन परिदृश्य व्यक्तिगत प्रयोगों से लेकर उद्यम उत्पादन तक के पूरे स्पेक्ट्रम को कवर करते हैं:
-
उत्पादन-स्तर एलएलएम अनुमान: उद्यम ग्राहक सेवा प्रणाली, सामग्री निर्माण और कोड सहायता जैसी उत्पादन प्रक्रियाओं में डीपसीक, क्वेन और लामा जैसे ओपन सोर्स मॉडल को एकीकृत करते हैं। ओपनएआई-संगत एपीआई माइग्रेशन लागत को लगभग शून्य कर देते हैं, और लाभ बंद-स्रोत एपीआई से ओपन-सोर्स मॉडल पर स्विच करने के बाद कम लागत और बढ़ी हुई मॉडल स्वायत्तता में परिलक्षित होते हैं।
-
आरएजी और ज्ञान पुनर्प्राप्ति: एक पुनर्प्राप्ति वृद्धि पीढ़ी प्रणाली बनाने के लिए डीपइन्फ्रा के एम्बेडिंग मॉडल (बीजीई, ई5 श्रृंखला) और क्षमताओं को पुन: व्यवस्थित करना। वही एपीआई कुंजी प्रौद्योगिकी स्टैक को सरल बनाते हुए, एम्बेडिंग और जनरेटिंग मॉडल को कॉल करती है। अधिकतम टोकन सीमा (512 या 8K) और विभिन्न एम्बेडिंग मॉडल की बहु-भाषा अनुकूलनशीलता पर ध्यान दें।
-
छवि और वीडियो निर्माण: ई-कॉमर्स उत्पाद छवियां, विज्ञापन क्रिएटिव और अवधारणा डिजाइन तैयार करने के लिए फ्लक्स श्रृंखला मॉडल का उपयोग करें। बिलिंग रिज़ॉल्यूशन और पुनरावृत्तियों की संख्या पर आधारित है, जो उन टीमों के लिए उपयुक्त है जिन्हें बार-बार छवियां बनाने की आवश्यकता होती है। FLUX-2-klein श्रृंखला एक हल्का मॉडल है जिसे तेजी से और कम लागत पर तैयार किया जा सकता है।
-
मल्टीमॉडल दस्तावेज़ समझ: चालान पहचान, अनुबंध जानकारी निष्कर्षण और फॉर्म ओसीआर के लिए जेम्मा 4, क्वेन-वीएल और अन्य मॉडल का उपयोग करें। दस्तावेज़ स्क्रीनशॉट सीधे विज़न एपीआई के माध्यम से पारित किए जाते हैं, जिससे प्री-प्रोसेसिंग पाइपलाइन की आवश्यकता समाप्त हो जाती है।
-
एजेंट और टूल कॉलिंग: डीपसीक वी4-प्रो, क्लाउड फैबल 5 और अन्य मॉडल फंक्शन कॉलिंग और टूल कॉलिंग का समर्थन करते हैं, जिसका उपयोग एआई एजेंट एप्लिकेशन बनाने के लिए किया जा सकता है। प्राथमिकता सेवा स्तर एजेंट बहु-चरणीय तर्क के लिए कम विलंबता सुनिश्चित करते हैं।
-
मॉडल फाइन-ट्यूनिंग और निजी परिनियोजन: उत्पादन ट्रैफ़िक की सेवा के लिए स्वचालित विस्तार और संकुचन के साथ संयुक्त, डीपइन्फ्रा जीपीयू पर अपना स्वयं का फाइन-ट्यूनिंग मॉडल तैनात करें। उन उद्यमों के लिए उपयुक्त जिनके पास डेटा संप्रभुता आवश्यकताएं हैं या मॉडल व्यवहार को अनुकूलित करने की आवश्यकता है।
लागू लोग
डीपइन्फ्रा का मल्टी-लेयर सर्विस फॉर्म निम्नलिखित चार प्रकार की भूमिकाओं को कवर करता है:
-
एआई एप्लिकेशन डेवलपर्स: एपीआई संगतता, मॉडल समृद्धि और कीमत पर ध्यान केंद्रित करते हुए, अनुमान क्षमताओं को जल्दी से एकीकृत करने की आवश्यकता है। डीपइन्फ्रा का ओपनएआई संगत एपीआई लगभग बिना किसी कोड संशोधन के ओपनएआई से माइग्रेट करना संभव बनाता है, जो इसे मॉडल चयन सत्यापन और उत्पादन परिनियोजन के लिए उपयुक्त बनाता है।
-
डेवऑप्स और इंफ्रास्ट्रक्चर टीम: जीपीयू क्लस्टर प्रबंधन और अनुमान लागत अनुकूलन के लिए जिम्मेदार। डीपइन्फ्रा के डीपसीटीएल सीएलआई, निजी परिनियोजन और डीपक्लस्टर विकल्प इसे प्रबंधित एपीआई से बेयर मेटल जीपीयू तक नियंत्रण का पूर्ण ग्रेडिएंट देते हैं।
-
एआई शोधकर्ता और प्रयोगकर्ता: तुलनात्मक मूल्यांकन के लिए विभिन्न मॉडलों के बीच बार-बार स्विच करने की आवश्यकता होती है। डीपइन्फ्रा की 100+ मॉडल लाइब्रेरी और एकीकृत एपीआई मल्टी-मॉडल मूल्यांकन के इंजीनियरिंग ओवरहेड को कम करते हैं।
-
एंटरप्राइज़ एआई प्लेटफ़ॉर्म लीडर: अनुपालन, सुरक्षा और लागत के लिए अनुमान विक्रेताओं का मूल्यांकन करें। डीपइन्फ्रा का एसओसी 2/आईएसओ 27001 प्रमाणन, शून्य डेटा प्रतिधारण नीति और संयुक्त राज्य अमेरिका में स्व-निर्मित डेटा केंद्र सार्वजनिक क्लाउड एपीआई से प्रमुख अंतर हैं।
सीमाओं के लिए उपयुक्त नहीं: डीपइन्फ्रा उन परिदृश्यों के लिए उपयुक्त नहीं है जिनके लिए एकल मॉडल विक्रेता पारिस्थितिकी तंत्र (जैसे एंटरप्राइज़ अनुबंध जिनके लिए एज़्योर ओपनएआई की आवश्यकता होती है) के लिए गहन बंधन की आवश्यकता होती है, वैश्विक बहु-क्षेत्र परिनियोजन की तत्काल आवश्यकता होती है (वर्तमान में मुख्य रूप से अमेरिकी डेटा केंद्र), या व्यक्तिगत प्रयोग परिदृश्य जिनके लिए बहुत कम अनुमान की आवश्यकता होती है और विलंबता के प्रति संवेदनशील नहीं होते हैं (इस मामले में, मुफ्त या सस्ते विकल्प अधिक उपयुक्त होते हैं)।
सारांश और आउटलुक
डीपइन्फ्रा की मुख्य प्रतिस्पर्धात्मकता "ओपन सोर्स मॉडल इकोसिस्टम + ओपनएआई संगत एपीआई + स्व-निर्मित अनुमान बुनियादी ढांचे" के ऊर्ध्वाधर एकीकरण में निहित है। यह सबसे सस्ता अनुमान एपीआई नहीं है (कुछ मॉडल फ्लेक्स टियर बहुत कम लागत पर प्राप्त कर सकते हैं), न ही यह सबसे अधिक सुविधा संपन्न है (कोई मॉडल प्रशिक्षण सेवाएं प्रदान नहीं की जाती हैं), लेकिन विकास टीमों और उद्यमों के लिए जिन्हें उत्पादन वातावरण में बड़े पैमाने पर ओपन सोर्स मॉडल का उपयोग करने की आवश्यकता होती है, यह संगतता, मॉडल चौड़ाई और बुनियादी ढांचे की नियंत्रणीयता के बीच मौजूदा बाजार में एक दुर्लभ संतुलन प्रदान करता है।
वर्तमान सीमाएँ: डेटा केंद्र वर्तमान में सीमित वैश्विक कवरेज के साथ संयुक्त राज्य अमेरिका में केंद्रित हैं; डिफ़ॉल्ट 200 समवर्ती सीमा के लिए उच्च-यातायात परिदृश्यों के लिए अतिरिक्त व्यावसायिक संचार की आवश्यकता होती है; प्लेटफ़ॉर्म स्वयं मॉडल प्रशिक्षण या फ़ाइन-ट्यूनिंग सेवाएँ प्रदान नहीं करता है, और केवल अनुमान परत पर ध्यान केंद्रित करता है।
खरीद/गोद लेने का जोखिम मूल्यांकन: उद्यमशील टीमों और छोटे और मध्यम आकार के डेवलपर्स के लिए, प्रोटोटाइप के माध्यम से चलाने के लिए पहले मानक स्तर + पे-एज़-यू-गो प्रोटोटाइप का उपयोग करने की सिफारिश की जाती है, एपीआई संगतता और मॉडल प्रभावों को सत्यापित करें, और फिर मूल्यांकन करें कि वास्तविक उपयोग के आधार पर प्राथमिकता स्तर या निजी तैनाती की आवश्यकता है या नहीं। खरीदने से पहले, उद्यमों को पुष्टि करने की आवश्यकता है: समवर्ती कोटा वृद्धि प्रक्रिया, डेटा प्रतिधारण रणनीति की विशिष्ट शर्तें (विशेष रूप से सेवा सुधार के लिए इनपुट और आउटपुट का उपयोग किया जाता है), डीपक्लस्टर अनुबंध की शीघ्र समाप्ति की शर्तें, और गैर-अमेरिकी डेटा केंद्रों के लिए भविष्य की कवरेज योजनाएं। पहले से ही ओपनएआई एपीआई का उपयोग करने वाली टीमों के लिए, डीपइन्फ्रा ओपन सोर्स मॉडल के लिए एक कम-माइग्रेशन लागत वाला विकल्प है, लेकिन इसे बंद स्रोत मॉडल के लिए पूर्ण प्रतिस्थापन नहीं माना जाना चाहिए - कुछ परिदृश्य (उदाहरण के लिए बहुत लंबी संदर्भ भूमिका-प्लेइंग, डोमेन-विशिष्ट बंद स्रोत मॉडल) को अभी भी कई विक्रेताओं को बनाए रखने की आवश्यकता होगी।
संबंधित टूल: <एक्सलिंक टाइप='टूल' स्लग='हगिंग-फेस'>, <एक्सलिंक टाइप='टूल' स्लग='रेप्लिकेट'>
डीपइन्फ्रा का प्लेटफ़ॉर्म संस्करण विकास
SaaS प्लेटफ़ॉर्म के रूप में, DeepInfra के पास पारंपरिक अर्थों में सॉफ़्टवेयर संस्करण संख्या नहीं है। इसका विकास मॉडल समर्थन विस्तार, हार्डवेयर उन्नयन और वित्तपोषण मील के पत्थर में परिलक्षित होता है।
मंच का प्रारंभिक चरण (2022-2024)
- सितंबर 2022: कंपनी की स्थापना, पूर्व-आईएमओ टीम द्वारा स्थापित।
- 2023–2024: अनुमान एपीआई का प्रारंभिक संस्करण लॉन्च करें, धीरे-धीरे ओपन सोर्स मॉडल समर्थन जोड़ें, और यूएस डेटा सेंटर इंफ्रास्ट्रक्चर स्थापित करें।
उच्च गति विस्तार चरण (2025)
- मॉडल लाइब्रेरी का विस्तार 100+ तक किया गया: मुख्यधारा के ओपन सोर्स एलएलएम, मल्टी-मोडल, इमेज जेनरेशन और स्पीच मॉडल को कवर किया गया।
- हार्डवेयर अपग्रेड: अनुमान थ्रूपुट और ऊर्जा दक्षता में सुधार के लिए H200 और B200 GPU समर्थन का परिचय।
- अनुपालन प्रमाणन: एसओसी 2 और आईएसओ 27001 प्रमाणन प्राप्त किया, और शून्य डेटा प्रतिधारण रणनीति लागू की।
सीरीज बी मील के पत्थर (2026-05)
- 4 मई, 2026: श्रृंखला बी वित्तपोषण में $107 मिलियन की घोषणा की गई, श्रृंखला ए की तुलना में टोकन प्रसंस्करण की मात्रा 25 गुना बढ़ गई।
- डीपक्लस्टर रिलीज: बी300 एक्सक्लूसिव जीपीयू क्लस्टर रेंटल सेवा लॉन्च की गई, 5 साल का अनुबंध $1.98/जीपीयू-एच।
- नए मॉडलों तक निरंतर पहुंच: नवीनतम मॉडल जैसे एंथ्रोपिक क्लाउड फैबल 5, क्लाउड सॉनेट 5, जीएलएम-5.2, किमी के2.7-कोड, क्यूवेन3.6, आदि सभी रिलीज के तुरंत बाद ऑनलाइन उपलब्ध हैं।
संस्करण जानकारी
- डीपइन्फ्रा सीरीज बी संस्करण :सीरीज बी वित्तपोषण से 107 मिलियन अमेरिकी डॉलर जुटाए गए; सीरीज ए की तुलना में टोकन प्रोसेसिंग वॉल्यूम 25 गुना बढ़ गया; डीपक्लस्टर बी300 क्लस्टर लॉन्च किया गया; क्लाउड फैबल 5/सॉनेट 5, जीएलएम-5.2, किमी के2.7-कोड और अन्य मॉडल जोड़े गए; 8 अमेरिकी डेटा सेंटर संचालित किए गए।
- डीपस्टार्ट उद्यमिता योजना :स्टार्ट-अप के लिए 1 बिलियन मुफ़्त टोकन कार्यक्रम लॉन्च किया गया, जिसके लिए 250,000-10 मिलियन अमेरिकी डॉलर के वित्तपोषण की आवश्यकता होती है और इसे 2 साल से अधिक समय पहले स्थापित नहीं किया गया था। अभी तक कोई आधिकारिक सटीक तारीख नहीं है।
- श्रृंखला ए मील के पत्थर :श्रृंखला ए वित्तपोषण पूरा किया गया; तब से, टोकन प्रसंस्करण की मात्रा 25 गुना बढ़ गई है; 100+ तक विस्तारित मॉडल लाइब्रेरी; एसओसी 2/आईएसओ 27001 प्रमाणन प्राप्त किया। अभी तक कोई आधिकारिक सटीक तारीख और राशि नहीं है।
- मंच का प्रारंभिक संस्करण :डीपइन्फ्रा की स्थापना की गई, एआई अनुमान एपीआई का प्रारंभिक संस्करण लॉन्च किया गया, और स्क्रैच से एक अनुमान अनुकूलन बुनियादी ढांचे का निर्माण किया गया।
उपयोगकर्ता समीक्षाएं