सेरेब्रस अनुमान मुफ्त

-

सेरेब्रस इंट्रेंस जेनेरिक एआई अनुप्रयोगों के लिए सेरेब्रस द्वारा प्रदान की जाने वाली एक उच्च गति इंट्रेंस सेवा है। यह ओपनएआई संगत एपीआई, पायथन/नोड.जेएस एसडीके, क्लाउड कंसोल, प्लेग्राउंड, साझा सार्वजनिक एंडपॉइंट और एंटरप्राइज़ समर्पित एंडपॉइंट प्रदान करता है, जो वास्तविक समय चैट, कोड जनरेशन एजेंट वर्कफ़्लो, बैच प्रोसेसिंग और कम-विलंबता उत्पादन सेवाओं के लिए उपयुक्त है।

सेरेब्रस अनुमान उत्पाद इंटरफेस

सेरेब्रसइंफ़रेंस

मुख्य पैरामीटर और आँकड़े

प्रासंगिक जानकारी सार्वजनिक नहीं की गई है, कृपया आधिकारिक वास्तविक समय पृष्ठ देखें।

उपयोगकर्ता और बाज़ार की पहचान

सेरेब्रस इंफ़रेंस के उपयोगकर्ता प्रोफ़ाइल डेवलपर्स, प्लेटफ़ॉर्म इंजीनियरिंग टीमों और एंटरप्राइज़ एआई एप्लिकेशन टीमों के प्रति पक्षपाती हैं। आधिकारिक क्विकस्टार्ट सीधे पायथन, नोड.जेएस और कर्ल के लिए तीन पहुंच पथ प्रदान करता है। दस्तावेज़ में क्लाइन, ओपनकोड, वीएस कोड, लैंगचेन, पाइडैंटिकएआई, लाइवकिट, ब्राउजरबेस, एक्सा और अन्य इंजीनियरिंग परिदृश्यों के साथ ओपनएआई की संगतता को भी शामिल किया गया है, जो दर्शाता है कि यह तर्क बुनियादी ढांचे की एक परत की तरह है जिसे बिजनेस सिस्टम में एम्बेड किया जा सकता है।

डेवलपर अनुमोदन: ओपनएआई बेस यूआरएल के साथ संगत है, इसलिए मौजूदा ओपनएआई एसडीके प्रोजेक्ट्स को बेस_यूआरएल और एपीआई कुंजी को बदलकर माइग्रेट किया जा सकता है, जिससे क्लाइंट को फिर से लिखने, संदेश प्रारूप और बुनियादी त्रुटि प्रबंधन की लागत कम हो जाती है। पायथन एसडीके और नोड.जेएस एसडीके की स्वतंत्र रिलीज से टीम को सेरेब्रस-विशिष्ट पैरामीटर प्राप्त करने के लिए एक समर्पित एसडीके चुनने की सुविधा भी मिलती है।

उद्यम अनुमोदन: समर्पित समापन बिंदु उन ग्राहकों के लिए हैं जिन्हें आरक्षित क्षमता, स्थिर थ्रूपुट, निजी समापन बिंदु, कस्टम वजन और उत्पादन गारंटी की आवश्यकता होती है। आधिकारिक तौर पर सूचीबद्ध एंटरप्राइज़ मॉडल परिवार में क्वेन, ओपनएआई ओएसएस, मिनीमैक्स, जेम्मा, लामा, मिस्ट्रल, जेड.एआई, मूनशॉट, डीपसीक, स्टेपफन, बाइटडांस और सर्विसनाउ आदि शामिल हैं, जो दर्शाता है कि उत्पाद रणनीति केवल एक मॉडल पर दांव लगाने की नहीं है, बल्कि वेफर-स्तरीय इंट्रेंस प्लेटफॉर्म को मल्टी-मॉडल सर्विस लेयर में पैकेज करने की है।

बाज़ार सिग्नल सीमा: सार्वजनिक जानकारी अद्वितीय भुगतान करने वाले ग्राहकों की संख्या, राजस्व, प्रतिधारण दर या उद्योग वितरण का खुलासा नहीं करती है; इसलिए, मूल्यांकन करते समय "गति कथा" को सीधे उत्पादन उपलब्धता निष्कर्षों के साथ नहीं जोड़ा जाना चाहिए। एक अधिक विश्वसनीय तरीका तनाव परीक्षण के लिए लक्ष्य मॉडल, लक्ष्य संदर्भ लंबाई, लक्ष्य समवर्तीता और लक्ष्य प्रतिक्रिया प्रारूप का उपयोग करना है, और फिर दर सीमा, बजट, त्रुटि दर और आधिकारिक व्यावसायिक शर्तों को जोड़कर निर्णय लेना है।

लागत लाभ

सेरेब्रस इंफ़रेंस का लागत लाभ केवल "सबसे सस्ता टोकन" नहीं है, बल्कि वास्तविक समय के उत्पादों की प्रतीक्षा लागत को कम करने के लिए तेज़ पीढ़ी की गति और विभिन्न चरणों में संसाधन आवश्यकताओं से मेल खाने के लिए साझा एंडपॉइंट या समर्पित एंडपॉइंट का उपयोग है। आधिकारिक मॉडल कैटलॉग में कहा गया है कि सार्वजनिक समापन बिंदु मॉडल उपयोग करने के लिए स्वतंत्र हैं, लेकिन दर सीमा के अधीन हैं; दस्तावेज़ीकरण का दर सीमा पृष्ठ नि:शुल्क परीक्षण और डेवलपर भुगतान के बीच सीमा अंतर को भी सूचीबद्ध करता है।

उपयोग स्तर लागत/प्रतिबंध सूचना का प्रकटीकरण उपयुक्त परिदृश्य नोट्स
नि:शुल्क परीक्षण सार्वजनिक समापन बिंदु आरपीएम, टीपीएम, टीपीएच, टीपीडी द्वारा सीमित उपयोग के लिए निःशुल्क हैं प्रोटोटाइप, मॉडल मूल्यांकन, कम-आवृत्ति डेमो उदाहरण के लिए, gpt-oss-120b फ्री टियर सार्वजनिक सीमा 5 RPM, 30K TPM, 1M TPH, 1M TPD है
जैसे ही आप जाएं डेवलपर भुगतान करें डेवलपर स्तर का उपयोग बजट के आधार पर किया जाता है, दस्तावेज़ीकरण उच्च आरपीएम/टीपीएम सूचीबद्ध करता है अनुप्रयोग विकास, प्रारंभिक उत्पादन, सतत मूल्यांकन gpt-oss-120b डेवलपर स्तर 1K RPM, 1M TPM की सीमा के अधीन है
बैच एपीआई निजी पूर्वावलोकन, बैच अतुल्यकालिक प्रसंस्करण, आधिकारिक विवरण 50% लागत बचत ला सकता है बड़े पैमाने पर मूल्यांकन, डेटा एनोटेशन, बैच सारांश बैच प्रोसेसिंग को पूरा होने में 24 घंटे तक का समय लग सकता है, निजी पूर्वावलोकन चरण के दौरान एसडीके समर्थन सीमित है
समर्पित समापन बिंदु उद्यम व्यवसाय संचार, आरक्षित क्षमता और निजी समापन बिंदु उच्च संगामिति, कम विलंबता, स्थिर एसएलए, निजी वजन मूल्य एसएलए, क्षमता और डेटा शर्तों के लिए व्यावसायिक पुष्टि की आवश्यकता होती है

वास्तविक खरीद के दौरान तीन प्रकार की लागतों की अलग-अलग गणना की जानी चाहिए: मॉडल अनुमान टोकन लागत, प्रतिक्रिया गति के कारण उत्पाद अनुभव लागत, और इंजीनियरिंग पहुंच और शासन लागत। रीयल-टाइम वॉयस और कोड पूर्णता एजेंट टूल चेन जैसे अनुप्रयोगों के लिए, जहां "एक सेकंड धीमा अनुभव को काफी कम कर देगा", सेरेब्रस की गति एकल-टोकन उद्धरण की तुलना में अधिक महत्वपूर्ण हो सकती है; ऑफ़लाइन बैच प्रोसेसिंग के लिए, बैच एपीआई और एसिंक्रोनस पूर्णता विंडो अधिक ध्यान देने योग्य हैं।

मुख्य कार्य

  • चैट पूर्णता और पूर्णता: वार्तालाप सहायकों, कोड निर्माण, संक्षेपण, पुनर्प्राप्ति वृद्धि और बहु-राउंड वर्कफ़्लो के लिए उपयुक्त ओपनएआई-शैली चैट और पूर्णता इंटरफ़ेस प्रदान करता है।
  • स्ट्रीमिंग प्रतिक्रियाएँ: स्ट्रीमिंग आउटपुट का समर्थन करता है, वास्तविक समय यूआई, वॉयस लिंक और इंटरैक्टिव अनुभवों के लिए उपयुक्त है जिसके लिए तेज़ प्रथम टोकन फीडबैक की आवश्यकता होती है।
  • ओपनएआई संगत: माइग्रेशन लागत को कम करने के लिए ओपनएआई पायथन/नोड.जेएस क्लाइंट का उपयोग https://api.cerebras.ai/v1 से कनेक्ट करने के लिए किया जा सकता है।
  • संरचित आउटपुट: जेएसओएन स्कीमा और सख्त मोड के माध्यम से आउटपुट प्रारूप को सीमित करता है, जो एलएलएम को व्यावसायिक डेटाबेस, अनुमोदन प्रवाह और स्वचालित पाइपलाइनों से जोड़ने के लिए उपयुक्त है।
  • टूल कॉलिंग: मॉडल को बाहरी टूल कॉल का अनुरोध करने की अनुमति देने का समर्थन करता है, और एपीआई v2 में मल्टी-राउंड टूल संदेश सत्यापन को मजबूत करता है।
  • तर्क नियंत्रण: तर्क मॉडल, तर्क_प्रयास, तर्क_प्रारूप और तर्क_लॉगप्रॉब्स जैसी क्षमताओं को कवर करने वाला दस्तावेज़ीकरण।
  • प्रॉम्प्ट कैशिंग: समान अनुरोधों के लिए पहले टोकन के समय में सुधार करने के लिए बार-बार प्रॉम्प्ट उपसर्गों का पुन: उपयोग करें।
  • बैच एपीआई और फ़ाइलें एपीआई: अतुल्यकालिक बड़े पैमाने पर अनुरोध प्रसंस्करण के लिए उपयोग किया जाता है, मूल्यांकन, एनोटेशन, बैच सारांश और प्रयोगों के लिए उपयुक्त।
  • क्लाउड कंसोल और प्लेग्राउंड: एपीआई कुंजी, प्रोजेक्ट, उपयोग, बिलिंग, संगठन पहुंच और इंटरैक्टिव मॉडल परीक्षण प्रबंधित करें।
  • समर्पित समापन बिंदु: एंटरप्राइज निजी उच्च-प्रदर्शन समापन बिंदु, आरक्षित क्षमता, कस्टम वजन प्रबंधन एपीआई, प्रोमेथियस मेट्रिक्स और सेवा परत नियंत्रण का समर्थन करते हैं।

मॉडल और संस्करण विकास

सेरेब्रस अनुमान के संस्करण विकास को तीन पंक्तियों में विभाजित किया गया है: एपीआई व्यवहार संस्करण, मॉडल निर्देशिका परिवर्तन एसडीके संस्करण। एपीआई व्यवहार के लिए वर्तमान सबसे महत्वपूर्ण नोड संस्करण 2 है: 2026-01-21 को परीक्षण के लिए खुला और 2026-07-21 को डिफ़ॉल्ट संस्करण बन गया, जो संरचित आउटपुट, टूल कॉल रीजनिंग लॉगप्रोब्स और यूनिकोड लॉगप्रोब्स को प्रभावित करता है।

समय परिवर्तन प्रभाव
2026-06-01 समर्पित समापन बिंदु जोड़े गए स्टेपफन चरण 3.5 फ्लैश, चरण 3.7 फ्लैश एंटरप्राइज़ मॉडल परिवार का विस्तार जारी है
2026-05-01 प्रोजेक्ट्स जीए एपीआई कुंजी, उपयोग विश्लेषण दर सीमा और सदस्य पहुंच को परियोजना द्वारा अलग किया जा सकता है
2026-04-24 सत्यापन त्रुटियों को 422 से 400 तक समायोजित किया गया SDK त्रुटि प्रकार UnprocessableEntityError से BadRequestError में बदल गया
2026-04-22 prompt_cache_key जोड़ा गया शीघ्र कैशिंग हिट दर में सुधार करें
2026-01-21 एपीआई वी2 खुला परीक्षण 2026-07-21 डिफ़ॉल्ट स्विचिंग पर माइग्रेशन की तैयारी
2025-08-13 gpt-oss-120b उत्पादन समर्थन में प्रवेश करता है वर्तमान साझा समापन बिंदु उत्पादन मॉडल मेनलाइन बन जाता है
2024-10-03 प्रारंभिक सार्वजनिक क्षमता अद्यतन लामा 3.1 हाई-स्पीड अनुमान ऑटोजेन एकीकृत प्लेग्राउंड लॉगिन और पैरामीटर नामकरण समायोजन

मॉडल निर्देशिका से, 2026-06-28 तक, सार्वजनिक समापन बिंदु साझा करने वाला उत्पादन मॉडल gpt-oss-120b है; पूर्वावलोकन मॉडल में zai-glm-4.7 और gemma-4-31b शामिल हैं। समर्पित समापन बिंदु एक व्यापक मॉडल परिवार को कवर करते हैं और ग्राहक-परिभाषित वजन का समर्थन करते हैं। इसका मतलब यह है कि मॉडल का चयन करते समय उपयोगकर्ता न केवल यह देख सकते हैं कि "कौन से मॉडल परिवार सेरेब्रा द्वारा समर्थित हैं", बल्कि "साझा सार्वजनिक एंडपॉइंट्स जिन्हें सीधे कॉल किया जा सकता है" और "समर्पित एंटरप्राइज़ एंडपॉइंट्स जिन्हें तैनात किया जा सकता है" के बीच अंतर भी कर सकते हैं।

तकनीकी लाभ

हाई-स्पीड आउटपुट और वास्तविक समय उत्पाद अनुकूलन: मॉडल निर्देशिका से पता चलता है कि gpt-oss-120b नाममात्र लगभग 3000 टोकन/सेकेंड है, zai-glm-4.7 लगभग 1000 टोकन/सेकेंड है, और जेम्मा 4 31बी लगभग 1850 टोकन/सेकेंड है। कोड सहायकों, वास्तविक समय ग्राहक सेवा, वॉयस एजेंटों और इंटरैक्टिव अनुसंधान सहायकों के लिए, गति लाभ सीधे प्रभावित करता है कि उपयोगकर्ता मॉडल के पूरा होने तक प्रतीक्षा करने के इच्छुक हैं या नहीं।

ओपनएआई संगत माइग्रेशन: बस ओपनएआई क्लाइंट के बेस यूआरएल को https://api.cerebras.ai/v1 में बदलें, और फिर बड़ी संख्या में मौजूदा संदेश प्रारूपों, स्ट्रीमिंग आउटपुट और त्रुटि प्रबंधन तर्क का पुन: उपयोग करने के लिए सेरेब्रस एपीआई कुंजी पास करें। माइग्रेशन लागत जितनी कम होगी, टीमों के लिए सेरेब्रा को ए/बी परीक्षण या मल्टी-वेंडर रूटिंग में डालना उतना ही आसान होगा।

संपूर्ण संरचना और टूल कॉलिंग क्षमताएं: संरचित आउटपुट, टूल कॉलिंग, समानांतर टूल कॉलिंग, और तर्क नियंत्रण लॉगप्रॉब, प्रॉम्प्ट कैशिंग और अनुमानित आउटपुट, जो इसे न केवल "चैटिंग" एंडपॉइंट बनाता है, बल्कि एजेंट ऑर्केस्ट्रेशन, बिजनेस ऑटोमेशन और मूल्यांकन पाइपलाइनों में प्रवेश कर सकता है।

एंटरप्राइज़ एंडपॉइंट्स और ऑब्जर्वेबिलिटी: डेडिकेटेड एंडपॉइंट्स निजी आरक्षित क्षमता प्रबंधन एपीआई, मेट्रिक्स एपीआई और प्रोमेथियस-संगत संकेतक प्रदान करता है, जो एंटरप्राइज़ की मौजूदा निगरानी और रिलीज प्रक्रिया में उच्च-थ्रूपुट अनुमान को एकीकृत कर सकता है। उत्पादन कार्यभार के लिए जिसके लिए स्थिर विलंबता और गारंटीकृत क्षमता की आवश्यकता होती है, यह साझा समापन बिंदुओं की तुलना में अधिक महत्वपूर्ण है।

कैसे उपयोग करें

उपयोग पथ बहुत सीधा है: पहले क्लाउड कंसोल में रजिस्टर करें या लॉग इन करें और एक एपीआई कुंजी बनाएं; फिर SDK इंस्टॉल करें या https://api.cerebras.ai/v1/chat/completions तक पहुंचने के लिए cURL का उपयोग करें; अंत में खेल के मैदान में प्रभाव, लॉग दर सीमा हेडर और प्रोजेक्ट उपयोग का निरीक्षण करें।

पथ प्रवेश विशिष्ट कदम भीड़ के लिए उपयुक्त
पायथन एसडीके पाइप इंस्टाल--अपग्रेड सेरेब्रस_क्लाउड_एसडीके CEREBRAS_API_KEY सेट करें -> Cerebras क्लाइंट प्रारंभ करें -> chat.completions.create पर कॉल करें पायथन बैकएंड, डेटा साइंस, मूल्यांकन स्क्रिप्ट
नोड.जेएस एसडीके npm इंस्टाल @cerebras/cerebras_cloud_sdk@latest प्रासंगिक चर सेट करें -> क्लाइंट बनाएं -> कॉल चैट पूर्णताएं वेब बैकएंड नोड सेवा, फ्रंट-एंड टूल श्रृंखला
OpenAI संगत ओपनएआई एसडीके + सेरेब्रस बेस यूआरएल आधार URL और API कुंजी बदलें -> मौजूदा OpenAI स्टाइल कोड का पुन: उपयोग करें वे टीमें जिनके पास पहले से ही OpenAI एक्सेस है
क्लाउड कंसोल https://cloud.cerebras.ai/ एपीआई कुंजियाँ, प्रोजेक्ट, बिल, उपयोग का प्रबंधन करें खेल का मैदान उत्पाद, इंजीनियरिंग, प्लेटफ़ॉर्म टीमें
समर्पित समापन बिंदु आधिकारिक वेबसाइट संपर्क/एंटरप्राइज़ संचार मॉडल, थ्रूपुट, विलंब, वजन एसएलए, निगरानी आवश्यकताओं को स्पष्ट करें -> समर्पित समापन बिंदु के लिए आवेदन करें उद्यम उत्पादन प्रणाली

विलंब-संवेदनशील परिदृश्य, जैसे कोड पूर्णता, खोज सारांश या एजेंट टूल कॉलिंग लिंक का चयन करने के लिए न्यूनतम व्यवहार्य पायलट की अनुशंसा की जाती है; प्रतिक्रिया समय, प्रथम टोकन समय, विफलता दर, आउटपुट प्रारूप स्थिरता और इकाई लागत की तुलना करने के लिए संकेतों के समान बैच का उपयोग करें। यदि आप संरचित आउटपुट या टूल कॉल का उपयोग करते हैं, तो आपको पहले से संगतता परीक्षण के लिए एपीआई v2 हेडर का उपयोग करना चाहिए, क्योंकि 2026-07-21 के बाद v2 डिफ़ॉल्ट बन जाएगा।

उत्पाद का मूल्य निर्धारण

आधिकारिक मूल्य निर्धारण की जानकारी मॉडल निर्देशिका दर सीमा, बैच और समर्पित समापन बिंदु दस्तावेज़ों में बिखरी हुई है। साझा सार्वजनिक समापन बिंदु मॉडल मुफ़्त है लेकिन सीमित है; डेवलपर पे एज़ यू गो उच्च सीमाएँ प्रदान करता है; बैच एपीआई अतुल्यकालिक स्केलिंग कार्यों के लिए है; समर्पित समापन बिंदुओं को क्षमता और वाणिज्यिक शर्तों की पुष्टि के लिए बिक्री से संपर्क करने की आवश्यकता होती है।

उत्पाद प्रपत्र सार्वजनिक मूल्य निर्धारण/प्रतिबंध प्रमुख मूल्य
सार्वजनिक समापन बिंदु निःशुल्क परीक्षण नि:शुल्क, संगठन-स्तरीय आरपीएम/टीपीएम/टीपीएच/टीपीडी प्रतिबंधों के अधीन त्वरित परीक्षण, सत्यापन गति और मॉडल प्रभाव
जैसे ही आप जाएं डेवलपर भुगतान करें दस्तावेज़ सूचियाँ डेवलपर दर सीमाएँ, शुल्क बजट और उपयोग के साथ भिन्न होते हैं उच्च थ्रूपुट, प्रारंभिक उत्पाद पहुंच के लिए उपयुक्त
बैच एपीआई निजी पूर्वावलोकन, आधिकारिक विवरण बैच प्रसंस्करण 50% लागत बचा सकता है गैर-वास्तविक समय के कार्य जैसे मूल्यांकन, एनोटेशन, बैच निर्माण, आदि
समर्पित समापन बिंदु उद्यम अनुकूलन आरक्षित क्षमता, स्थिर विलंबता, कस्टम वजन, उत्पादन एसएलए

सार्वजनिक पृष्ठ सभी मॉडलों के लिए एक निश्चित टोकन इकाई मूल्य सूची प्रदान नहीं करता है, न ही यह समर्पित समापन बिंदुओं के मानक वार्षिक और मासिक मूल्य का खुलासा करता है। इसलिए, औपचारिक खरीदारी से पहले, आपको पुष्टि करनी चाहिए: मॉडल आईडी, संदर्भ लंबाई, इनपुट और आउटपुट टोकन यूनिट मूल्य, मुफ्त कोटा, बजट ऊपरी सीमा दर सीमा, एसएलए, डेटा प्रतिधारण, लॉग दृश्यता, क्षेत्र और अनुपालन आवश्यकताएं।

अनुप्रयोग परिदृश्य

  • लाइव चैट और ग्राहक सेवा सहायक: कम-विलंबता प्रतिक्रिया बहु-राउंड वार्तालाप अनुभव को बेहतर बना सकती है, विशेष रूप से उन वेब या ऐप उत्पादों के लिए उपयुक्त जिन्हें स्ट्रीमिंग आउटपुट की आवश्यकता होती है।
  • एआई प्रोग्रामिंग असिस्टेंट: दस्तावेज़ीकरण क्लाइन, ओपनकोड, वीएस कोड इत्यादि जैसे एकीकरण पथ प्रदान करता है, जो कोड निर्माण, व्याख्या, मरम्मत और रीफैक्टरिंग सुझावों के लिए उपयुक्त है।
  • एजेंट वर्कफ़्लो: टूल इनवोकेशन, संरचित आउटपुट रीजनिंग नियंत्रण और मल्टी-स्टेप पुनर्प्राप्ति, खोज, ब्राउज़र स्वचालन और रिपोर्ट पीढ़ी के लिए उपयुक्त उच्च गति मॉडल।
  • RAG और ट्रिविया: प्रॉम्प्ट कैशिंग और prompt_cache_key लंबे उपसर्गों, ज्ञान आधारित विवरणों और सिस्टम-स्तरीय संदर्भों का पुन: उपयोग करने के लिए उपयुक्त हैं।
  • बैच मूल्यांकन और डेटा प्रोसेसिंग: बैच एपीआई JSONL फ़ाइलों का समर्थन करता है, 50,000 अनुरोधों के लिए 24 घंटे की पूर्णता विंडो, और ऑफ़लाइन मूल्यांकन और बड़े पैमाने पर सामग्री प्रसंस्करण के लिए उपयुक्त है।
  • उद्यम उच्च समवर्ती अनुमान: ग्राहक-सामना वाले उत्पादों के लिए समर्पित समापन बिंदु, स्थिर थ्रूपुट पाइपलाइन, निजी वजन परिनियोजन, और प्रोमेथियस निगरानी।

अनुपयुक्त परिदृश्यों को भी स्पष्ट करने की आवश्यकता है: यदि टीम को केवल ऑफ़लाइन कम-आवृत्ति पीढ़ी की आवश्यकता है, प्रतिक्रिया समय के प्रति संवेदनशील नहीं है, या ऐसे मॉडल का उपयोग करना चाहिए जो अभी तक साझा समापन बिंदु द्वारा प्रदान नहीं किया गया है, तो सेरेब्रस के फायदे कमजोर हो जाएंगे; यदि सख्त उद्यम अनुपालन और निजी भार की आवश्यकता है, तो समर्पित समापन बिंदु और व्यावसायिक पुष्टि का उपयोग किया जाना चाहिए।

लागू लोग

डेवलपर्स और स्टार्टअप टीमें: उन लोगों के लिए जो ओपनएआई संगत इंटरफेस के साथ मौजूदा अनुमान प्रदाताओं को जल्दी से बदलना या पूरक करना चाहते हैं। भुगतान या एंटरप्राइज़ पथ पर जाने का निर्णय लेने से पहले सार्वजनिक समापन बिंदुओं के साथ गति, आउटपुट गुणवत्ता और संरचना क्षमताओं को सत्यापित करें।

एआई प्लेटफ़ॉर्म टीम: उन टीमों के लिए उपयुक्त जिन्हें एपीआई कुंजी, प्रोजेक्ट, उपयोग दर सीमा, त्रुटि प्रबंधन और मल्टी-मॉडल रूटिंग को समान रूप से प्रबंधित करने की आवश्यकता होती है। सेरेब्रा की ताकत इसकी गति, ओपनएआई अनुकूलता और एंटरप्राइज एंडपॉइंट पोर्टफोलियो में निहित है।

एजेंट और ऑटोमेशन टीम: सर्च एजेंट, रिसर्च एजेंट, कोड एजेंट, वॉयस एजेंट और टूल कॉलिंग लिंक बनाने के लिए उपयुक्त। उच्च गति प्रतिक्रिया बहु-चरणीय लिंक के कुल प्रतीक्षा समय को कम कर सकती है।

एंटरप्राइज़ इंजीनियरिंग टीम: आरक्षित क्षमता, उत्पादन एसएलए, प्रोमेथियस मेट्रिक्स, निजी समापन बिंदु, कस्टम वजन और उच्च थ्रूपुट की आवश्यकता वाले संगठनों के लिए। व्यावसायिक उपयोगकर्ताओं को डेटा प्रोसेसिंग, लॉग रिटेंशन, एक्सेस कंट्रोल, सेवा क्षेत्रों और समर्थन स्तरों की जाँच पर ध्यान केंद्रित करना चाहिए।

सावधानी के साथ सीमाओं का उपयोग करें: यदि एप्लिकेशन उन मॉडलों पर बहुत अधिक निर्भर करता है जो अभी भी पूर्वावलोकन में हैं, एपीआई v2 सत्यापन नियम जो बदलने वाले हैं, या मॉडल उपनाम जिन्हें लंबे समय तक ठीक करने की आवश्यकता है, तो ऑनलाइन होने से पहले माइग्रेशन योजना और रोलबैक रणनीति को लॉक किया जाना चाहिए। विशेष रूप से, संरचित आउटपुट और टूल कॉल के उपयोगकर्ताओं को 2026-07-21 से पहले v2 परीक्षण पूरा करना चाहिए।

सारांश और आउटलुक

सेरेब्रस अनुमान का मुख्य मूल्य सेरेब्रस की उच्च गति कंप्यूटिंग क्षमताओं को एक अनुमान एपीआई में पैकेज करना है जिसे डेवलपर्स सीधे कॉल कर सकते हैं: ओपनएआई वर्कफ़्लो के साथ संगत होने और माइग्रेशन थ्रेशोल्ड को कम करने के दौरान, यह समर्पित एंडपॉइंट के माध्यम से एंटरप्राइज़-स्तरीय कम-विलंबता और उच्च-थ्रूपुट उत्पादन परिदृश्यों को भी प्रदान करता है। साझा समापन बिंदुओं की वर्तमान मुख्य पंक्ति gpt-oss-120b पर केंद्रित है, एंटरप्राइज़ समापन बिंदु मॉडल परिवार व्यापक है, और उत्पाद रणनीति स्पष्ट रूप से दो परतों में विभाजित है: "सार्वजनिक समापन बिंदुओं के साथ त्वरित शुरुआत" और "विशेष समापन बिंदुओं का स्थिर उत्पादन"।

अगली सबसे उल्लेखनीय चीजें हैं एपीआई वी2 की डिफ़ॉल्ट स्विचिंग, निजी पूर्वावलोकन से जीए तक साझा सार्वजनिक एंडपॉइंट मॉडल कैटलॉग एक्सटेंशन जेम्मा 4 31बी बैच एपीआई की ऑनलाइन लय, समर्पित एंडपॉइंट्स के मॉडल परिवार का विस्तार, और अधिक बढ़िया कीमत और एसएलए पारदर्शिता। जो टीमें इसे अपनाने के लिए तैयार हैं, उनके लिए विलंबता, थ्रूपुट, प्रारूप स्थिरता और लागत तनाव परीक्षण करने के लिए वास्तविक व्यावसायिक संकेतों का उपयोग करने की अनुशंसा की जाती है, और फिर तय करें कि सेरेब्रस को मुख्य अनुमान लिंक, एक वैकल्पिक आपूर्तिकर्ता, या विशेष रूप से कम-विलंबता महत्वपूर्ण पथ पर रखा जाए या नहीं।

संबंधित टूल: <एक्सलिंक टाइप='टूल' स्लग='हगिंग-फेस'>, <एक्सलिंक टाइप='टूल' स्लग='रेप्लिकेट'>

मुख्य पैरामीटर और स्थिति

सेरेब्रस इंट्रेंस जेनेरिक एआई अनुप्रयोगों के लिए सेरेब्रस की इंट्रेंस एपीआई सेवा है। इसे एकल चैटबॉट के रूप में तैनात नहीं किया गया है, लेकिन यह डेवलपर्स को कम-विलंबता, उच्च-थ्रूपुट बड़े मॉडल एंडपॉइंट के साथ वास्तविक समय के एप्लिकेशन बनाने की अनुमति देता है। आधिकारिक वेबसाइट उत्पाद पृष्ठ इसे जेनरेटिव एआई के लिए एक उच्च गति अनुमान एपीआई के रूप में वर्णित करता है, और आधिकारिक दस्तावेज प्रवेश को क्लाउड कंसोल, एपीआई कुंजी, प्लेग्राउंड, मॉडल निर्देशिका, क्षमता दस्तावेज़ एपीआई संदर्भ, एसडीके और समर्पित एंडपॉइंट में विभाजित करता है।

प्रोजेक्ट्स सार्वजनिक सूचना
आधिकारिक वेबसाइट https://www.cerebras.ai/inference
दस्तावेज़ प्रवेश https://inference-docs.cerebras.ai/
एपीआई बेस यूआरएल https://api.cerebras.ai/v1
मुख्य इंटरफ़ेस चैट पूर्णताएँ, पूर्णताएँ, फ़ाइलें, बैच, मॉडल, मेट्रिक्स, ग्राहक प्रबंधन एपीआई
एसडीके पायथन सेरेब्रास-क्लाउड-एसडीके, नोड.जेएस @सेरेब्रास/सेरेब्रास_क्लाउड_एसडीके
साझा समापन बिंदु उत्पादन मॉडल जीपीटी-ओएसएस-120बी, 120बी पैरामीटर, लगभग 3000 टोकन/सेक
साझा समापन बिंदु पूर्वावलोकन मॉडल zai-glm-4.7, जेम्मा-4-31बी (जेम्मा एनोटेशन जल्द आ रहा है)
एंटरप्राइज फॉर्म समर्पित समापन बिंदु, आरक्षित क्षमता, कस्टम भार, प्रबंधन एपीआई, प्रोमेथियस मेट्रिक्स
नवीनतम सार्वजनिक परिवर्तन 2026-06-01 स्टेपफन चरण 3.5 फ्लैश और चरण 3.7 फ्लैश समर्पित मॉडल जोड़े गए

इसकी प्रमुख सीमाएँ भी स्पष्ट हैं: साझा सार्वजनिक समापन बिंदु तेजी से विकास, मूल्यांकन और हल्के उत्पादन सत्यापन के लिए बेहतर हैं; एंटरप्राइज़ समर्पित समापन बिंदु आरक्षित क्षमता, पूर्वानुमानित विलंबता, उत्पादन एसएलए, निजी उच्च-प्रदर्शन समापन बिंदु, कस्टम भार और उच्च-स्तरीय प्रशासन के लिए जिम्मेदार हैं। एजेंटों, कोड सहायकों, खोज क्यू एंड ए और वास्तविक समय वॉयस लिंक के लिए जिन्हें कम-विलंबता इंटरैक्शन की आवश्यकता होती है, सेरेब्रस अनुमान का मूल्य मुख्य रूप से प्रतिक्रिया गति और ओपनएआई संगत माइग्रेशन लागत में परिलक्षित होता है।

संस्करण जानकारी

  • सेरेब्रस अनुमान वर्तमान क्लाउड सेवा और समर्पित मॉडल अपडेट :सेरेब्रस इन्फेरेंस को क्लाउड एपीआई सेवा के रूप में तेजी से अद्यतन किया जा रहा है; आधिकारिक परिवर्तन लॉग में नवीनतम सार्वजनिक रिकॉर्ड 2026-06-01 है, जिसमें स्टेपफन स्टेप 3.5 फ्लैश और स्टेप 3.7 फ्लैश डेडिकेटेड एंडपॉइंट्स के लिए समर्थन जोड़ा गया है। एपीआई वी2 2026-01-21 को परीक्षण के लिए खुला है और 2026-07-21 को डिफ़ॉल्ट संस्करण बनने की योजना है; Python SDK का वर्तमान सार्वजनिक संस्करण 1.67.0 है।
  • एपीआई संस्करण 2 परीक्षण के लिए उपलब्ध है :एपीआई v2 परीक्षण के लिए खुला है, इसमें सख्त संरचित आउटपुट और टूल कॉल सत्यापन रीजनिंग_लॉगप्रोब्स फ़ील्ड और यूनिकोड लॉगप्रोब्स फिक्स जोड़े गए हैं; 2026-07-21 डिफ़ॉल्ट संस्करण बन जाएगा।
  • OpenAI GPT OSS 120B उत्पादन समर्थन :सेरेब्रस अनुमान परिवर्तन लॉग रिकॉर्ड जीपीटी-ओएसएस-120बी उत्पादन समर्थन में प्रवेश कर रहा है; वर्तमान मॉडल कैटलॉग इसे ~3000 टोकन/सेकेंड की नाममात्र गति के साथ सार्वजनिक समापन बिंदु साझा करने वाले उत्पादन मॉडल के रूप में सूचीबद्ध करता है।
  • सेरेब्रस अनुमान प्रारंभिक सार्वजनिक एपीआई क्षमताएं :परिवर्तन लॉग से पता चलता है कि शुरुआती सार्वजनिक क्षमताओं में पहले से ही लामा 3.1 श्रृंखला हाई-स्पीड अनुमान ऑटोजेन एकीकृत डेवलपर प्लेग्राउंड लॉगिन अनुकूलन और ओपनएआई स्टाइल पैरामीटर समायोजन शामिल है, जो बाद के मॉडल, टूल कॉलिंग और संरचित आउटपुट विस्तार की नींव रखता है।

उपयोगकर्ता समीक्षाएं

  • समीक्षाएं लोड हो रही हैं...