जेम्मा 4 12बी मुफ्त

-

जेम्मा 4 12बी गूगल का ओपन सोर्स मल्टी-मॉडल लार्ज मॉडल है। यह उद्योग के पहले एनकोडर-रहित एकीकृत आर्किटेक्चर को अपनाता है और टेक्स्ट, छवि, ऑडियो, वीडियो समझ और एजेंट तर्क का समर्थन करता है। इसे 16GB वीडियो मेमोरी वाले लैपटॉप पर स्थानीय रूप से चलाया जा सकता है।

जेम्मा 4 12बी उत्पाद इंटरफेस

जेम्मा 4 12बी: गूगल का ओपन सोर्स कोडर-रहित एकीकृत आर्किटेक्चर मल्टी-मोडल बड़ा मॉडल

मुख्य पैरामीटर और आँकड़े

प्रोजेक्ट विशेष विवरण
मॉडल/एपीआई नाम जेम्मा 4 12बी
उत्पाद प्रकार एआई मॉडल/एपीआई
डिलिवरी फॉर्म एपीआई/क्लाउड अनुमान/स्थानीय परिनियोजन
प्रसंग लंबाई 256K टोकन (पूर्ण मोडल संरेखण)
पैरामीटर आकार 12बी (सघन वास्तुकला)
समर्थन मोडल टेक्स्ट/छवि/ऑडियो/वीडियो
मूल्य निर्धारण मॉडल स्व-परिनियोजन के लिए निःशुल्क/शून्य लागत (अपाचे 2.0)
ओपन सोर्स लाइसेंस अपाचे 2.0

मुख्य मापदंडों की व्याख्या: जेम्मा 4 12बी का सबसे बड़ा अंतर एनकोडर-रहित एकीकृत आर्किटेक्चर है - पारंपरिक मल्टी-मोडल मॉडल छवियों/ऑडियो को टोकन में परिवर्तित करने और फिर उन्हें एलएलएम में भेजने के लिए स्वतंत्र दृश्य एनकोडर (जैसे सीएलआईपी वीआईटी) पर भरोसा करते हैं, जबकि जेम्मा 4 12बी सीधे दृश्य और ऑडियो डेटा को एलएलएम बैकबोन में इनपुट करता है, जिससे एनकोडर के कारण होने वाली सूचना बाधा और सूचना हानि को समाप्त किया जाता है। 256K पूर्ण-मोडल संदर्भ विंडो का मतलब है कि लंबे वीडियो, बहु-पृष्ठ दस्तावेज़ और लंबे ऑडियो सत्र सभी को एक ही पास में संसाधित किया जा सकता है, बिना सेगमेंट कांट-छांट की आवश्यकता के। 12बी डेंस पैरामीटर स्केल को उपभोक्ता-ग्रेड जीपीयू (16जीबी वीआरएएम) पर चलाया जा सकता है, जो इसकी "स्थानीय उपलब्धता" के लिए एक शर्त है। अपाचे 2.0 लाइसेंस अतिरिक्त शर्तों के बिना व्यावसायिक उपयोग, संशोधन और पुनर्वितरण की अनुमति देता है।

उपयोगकर्ता और बाज़ार की पहचान

जेम्मा 4 12बी की रिलीज़ के बाद, इसने ओपन सोर्स समुदाय और तकनीकी मीडिया में तेजी से व्यापक ध्यान आकर्षित किया। इसका कारण न केवल पैरामीटर स्केल का सरलीकरण है, बल्कि "एनकोडर-कम आर्किटेक्चर" द्वारा मल्टी-मोडल मॉडल डिज़ाइन प्रतिमान का संभावित तोड़फोड़ भी है। हगिंगफेस पर जेम्मा 4 श्रृंखला संग्रह पृष्ठ से पता चलता है कि 12बी संस्करण को रिलीज के पहले सप्ताह में सैकड़ों हजारों बार डाउनलोड किया गया था, जो उसी अवधि के दौरान शीर्ष ओपन सोर्स मॉडल डाउनलोड सूची बन गया। प्रमुख प्रौद्योगिकी मीडिया (द वर्ज, टेकक्रंच, आर्क्सिव समुदाय चर्चा) की रिपोर्टें तीन दिशाओं पर ध्यान केंद्रित करती हैं: पहला, क्या एनकोडर-रहित आर्किटेक्चर अधिक डाउनस्ट्रीम कार्यों में अपने दावा किए गए प्रदर्शन लाभों को पुन: पेश कर सकता है; दूसरा, अनुमान की गति कि 12बी पैरामीटर वास्तव में उपभोक्ता-ग्रेड हार्डवेयर पर उपलब्ध हैं; तीसरा, गैर-अंग्रेजी भाषाओं (विशेष रूप से चीनी) में मॉडल का प्रदर्शन - क्योंकि Google का दावा है कि इसने बहु-भाषा बेंचमार्क पर पिछले बड़े पैमाने के मॉडल को पीछे छोड़ दिया है।

डेवलपर समुदाय स्तर पर, GitHub और HuggingFace पर चर्चा मुख्य रूप से स्थानीय परिनियोजन की हार्डवेयर अनुकूलता (क्या 16GB वीडियो मेमोरी के साथ RTX 4060/4070 पूर्ण सटीकता को चलाने के लिए पर्याप्त है), ओलामा/एलएम स्टूडियो जैसे स्थानीय अनुमान ढांचे के साथ एकीकरण की प्रगति और फाइन-ट्यूनिंग टूल श्रृंखला की परिपक्वता के आसपास घूमती है। Google द्वारा आधिकारिक तौर पर प्रदान किया गया Gemma 4 12B macOS डेस्कटॉप एप्लिकेशन गैर-तकनीकी उपयोगकर्ताओं के लिए ओपन सोर्स मॉडल के लिए उद्योग का पहला स्थानीय रनिंग समाधान है। यह कदम बड़े ओपन सोर्स मॉडल का उपयोग करने की सीमा को कम करता है, लेकिन यह इस बारे में भी चर्चा शुरू करता है कि "क्या ओपन सोर्स मॉडल को ऐप स्टोर के माध्यम से वितरित किया जाना चाहिए।"

यह ध्यान रखना महत्वपूर्ण है कि मौजूदा बाजार उत्साह अभी भी प्रारंभिक अपनाने वाले चरण में है - मॉडल लगभग 6 सप्ताह पहले, जून 2026 में जारी किया जाएगा। बेंचमार्क परीक्षण डेटा और छोटे पैमाने पर सत्यापन परिणाम धीरे-धीरे समुदाय में उभर रहे हैं, लेकिन बड़े पैमाने पर उत्पादन वातावरण की स्थिरता, लंबी-पूंछ वाले कार्यों के क्षरण का जोखिम, और सामुदायिक पारिस्थितिकी की पूर्णता (फाइन-ट्यूनिंग उपकरण, मात्रात्मक समाधान, तैनाती टेम्पलेट) को अभी भी परीक्षण करने के लिए समय की आवश्यकता है।

लागत लाभ

लागत आयाम विवरण
मॉडल लाइसेंस $0 (अपाचे 2.0, कोई अतिरिक्त शर्तें नहीं)
क्लाउड एपीआई कॉल Google क्लाउड वर्टेक्स AI या अन्य होस्टिंग प्लेटफ़ॉर्म के माध्यम से प्रति-टोकन बिलिंग
स्व-तैनात हार्डवेयर 16GB+ VRAM GPU की आवश्यकता है (उपभोक्ता ग्रेड जैसे RTX 4060 Ti 16GB लगभग ¥3,500 है, RTX 4090 लगभग ¥13,000 है)
स्व-तैनाती अनुमान रूपरेखा ओलामा, एलएम स्टूडियो, वीएलएलएम, टेन्सोरआरटी-एलएलएम सभी संगत हैं
फाइन-ट्यूनिंग लागत पूर्ण पैरामीटर फ़ाइन-ट्यूनिंग के लिए 32GB+ VRAM की आवश्यकता होती है; LoRA/QLoRA को 16GB में पूरा किया जा सकता है

जेम्मा 4 12बी की लागत संरचना पारंपरिक बंद स्रोत मल्टी-मोडल मॉडल से मौलिक रूप से अलग है। तुलना के रूप में GPT-4o या क्लाउड 3.5 सॉनेट लें: बंद-स्रोत मॉडल को टोकन द्वारा बिल किया जाता है, और उच्च-आवृत्ति कॉल के लिए मासिक व्यय हजारों डॉलर तक पहुंच सकता है; जबकि जेम्मा 4 12बी की सीमांत कॉल लागत लगभग शून्य है - जब तक हार्डवेयर ठीक जगह पर है। हालाँकि, स्व-परिनियोजन मॉडल के लिए हार्डवेयर खरीद लागत को स्वामित्व की कुल लागत (टीसीओ) में परिशोधित करने की आवश्यकता होती है।

टीसीओ कटौती (12 महीने):

  • विकल्प ए (स्व-तैनाती): आरटीएक्स 4090 (¥13,000) + बिजली/कूलिंग (¥200/माह × 12 = ¥2,400) + संचालन और रखरखाव जनशक्ति (प्रति माह औसतन 4 घंटे × ¥200/घंटा × 12 = ¥9,600) = ¥25,000/वर्ष
  • विकल्प बी (एपीआई कॉल): 1M टोकन (इनपुट + आउटपुट) के दैनिक औसत को मानते हुए, समान पैरामीटर स्केल मॉडल पर आधारित एपीआई मूल्य निर्धारण लगभग $0.3/M टोकन है, और मासिक शुल्क लगभग $9 × 12 = ¥780/वर्ष है (लेकिन सेवा उपलब्धता और डेटा गोपनीयता के अधीन है)
  • विकल्प सी (हाइब्रिड): संवेदनशील डेटा का स्थानीय अनुमान प्रसंस्करण + उच्च-समवर्ती कार्यों का क्लाउड बैच प्रसंस्करण, गोपनीयता और लोच को ध्यान में रखते हुए

मुख्य निर्णय कारक: जब दैनिक कॉल की मात्रा लगभग 5M टोकन से अधिक हो जाती है, तो स्व-तैनाती की सीमांत लागत एपीआई समाधान से कम होने लगती है। डेटा गोपनीयता आवश्यकताएँ जितनी अधिक होंगी, कॉल आवृत्ति जितनी अधिक स्थिर होगी, और वह परिदृश्य जहाँ हार्डवेयर पहले से मौजूद होगा, स्व-परिनियोजन उतना ही अधिक किफायती होगा।

मुख्य कार्य

  • सभी तौर-तरीकों की एकीकृत समझ: पाठ, छवि, ऑडियो और वीडियो के चार तौर-तरीकों को एक ही मॉडल में समान रूप से संसाधित किया जाता है, जिससे विभिन्न तौर-तरीकों के लिए स्वतंत्र पाइपलाइन बनाने की आवश्यकता समाप्त हो जाती है। एक एकल अनुमान "चार्ट को देखना → रिकॉर्डिंग सुनना → विश्लेषण रिपोर्ट आउटपुट करना" के क्रॉस-मोडल कार्य को पूरा कर सकता है, जो कुछ ऐसा है जिसे पारंपरिक स्वतंत्र मॉडल संयोजन समाधान प्राप्त नहीं कर सकते हैं। वास्तविक उपयोग में, इनपुट मोडेलिटी की जटिलता (विशेष रूप से लंबे वीडियो के फ्रेम प्रोसेसिंग घनत्व) के आधार पर अनुमान की गति में काफी उतार-चढ़ाव होगा।
  • 256K अल्ट्रा-लॉन्ग कॉन्टेक्स्ट: एक समय में लगभग 200 पृष्ठों के दस्तावेज़ों या 1 घंटे से अधिक की वीडियो सामग्री के प्रसंस्करण का समर्थन करता है। लंबे दस्तावेज़ प्रश्नोत्तर, कोड वेयरहाउस-स्तरीय समझ और मल्टी-राउंड मीटिंग मिनट्स विश्लेषण जैसे परिदृश्यों में, 256K विंडो मॉडल को वार्तालाप-स्तर की स्थिरता बनाए रखने में सक्षम बनाती है। हालाँकि, यह ध्यान दिया जाना चाहिए कि लंबे संदर्भ तर्क के पहले टोकन विलंब में काफी वृद्धि होगी (इनपुट लंबाई के आनुपातिक), और लंबे संदर्भ में "ध्यान कमजोर पड़ने" की समस्या अभी तक पूरी तरह से हल नहीं हुई है - मॉडल संदर्भ की शुरुआत और अंत में सामग्री पर ध्यान केंद्रित करता है, और मध्य भाग में सूचना स्मरण दर कम हो सकती है।
  • एजेंट रीज़निंग: मॉडल मूल रूप से फ़ंक्शन कॉलिंग और चेन-ऑफ़-थॉट का समर्थन करता है, और स्वतंत्र रूप से मल्टी-स्टेप कार्य अपघटन और पर्यावरण इंटरैक्शन को पूरा कर सकता है। लैंगचेन और ऑटोजेन जैसे एजेंट फ्रेमवर्क के साथ संगतता को आधिकारिक Google नमूनों में प्रदर्शित किया गया है। एजेंट की क्षमताओं की मुख्य सीमा एकल-चरण तर्क की सफलता दर में निहित है - श्रृंखला संचालन में प्रत्येक चरण पर त्रुटियां जमा हो जाएंगी, और जटिल कार्यों की वास्तविक पूर्णता दर (5 चरणों से अधिक) को उपयोगकर्ताओं द्वारा अपने स्वयं के परिदृश्यों में सत्यापित करने की आवश्यकता है।
  • macOS नेटिव डेस्कटॉप एप्लिकेशन: पहली बार, Google ओपन सोर्स मॉडल के लिए डेस्कटॉप एप्लिकेशन की एक-क्लिक इंस्टॉलेशन प्रदान करता है, जो स्थानीय और पूर्ण ऑफ़लाइन ऑपरेशन का समर्थन करता है। एप्लिकेशन स्तर संवाद, फ़ाइल अपलोड (छवि/पीडीएफ/वीडियो), संदर्भ प्रबंधन और मॉडल स्विचिंग कार्यों को एकीकृत करता है। M सीरीज चिप्स (M3/M4) का macOS संस्करण Apple न्यूरल इंजन के माध्यम से कार्यान्वित किया जाता है

महत्वपूर्ण अनुमान त्वरण के लिए, Intel Mac केवल बुनियादी रनिंग मोड का समर्थन करता है।

मॉडल और संस्करण विकास

संस्करण दिनांक मुख्य परिवर्तन
जेम्मा 4 12बी v1.0 2026-06 पहली रिलीज, एनकोडर रहित एकीकृत आर्किटेक्चर, 256K संदर्भ, पूर्ण मोडल समर्थन, अपाचे 2.0
जेम्मा 4 सीरीज 2026-05 श्रृंखला की शुरुआत (12बी डेंस + 31बी डेंस/एमओई), आर्किटेक्चर सत्यापन

जेम्मा 4 12बी, जेम्मा 4 श्रृंखला का "छोटा पैरामीटर फ्लैगशिप" है - इसकी 12बी की सघन वास्तुकला श्रृंखला में 31बी के एमओई संस्करण के साथ एक पूरक स्थिति बनाती है: 12बी स्थानीय तैनाती और कम-विलंबता परिदृश्यों पर केंद्रित है, और 31बी क्लाउड में उच्च-सटीक कार्यों के लिए उन्मुख है। जेम्मा श्रृंखला की विकास वंशावली को देखते हुए, जेम्मा 1 (2बी/7बी, 2024-02) से जेम्मा 2 (9बी/27बी, 2024-06) से जेम्मा 3 (1बी/12बी/27बी, 2025-03) और फिर जेम्मा 4 तक वास्तुशिल्प परिवर्तन - एनकोडर-रहित आर्किटेक्चर इस प्रस्ताव का एक सकारात्मक जवाब है कि "मजबूत छोटे मापदंडों के साथ मल्टी-मोडेलिटी हासिल की जा सकती है"। हालांकि पिछले जेम्मा 3 का 12बी संस्करण था, यह स्वतंत्र विज़ुअल एनकोडर (सिगलिप) और ऑडियो एनकोडर (व्हिस्पर) पर निर्भर था, जिसके परिणामस्वरूप उच्च मल्टी-मोडल तर्क विलंब और कम क्रॉस-मोडल सूचना संरेखण दक्षता हुई। जेम्मा 4 12बी की अनुमान विलंबता जेम्मा 3 12बी (Google आधिकारिक डेटा) की तुलना में लगभग 40% कम है, और मोडल संरेखण सटीकता में 12-18 प्रतिशत अंक (एमएमएमयू और वीडियो-एमएमई बेंचमार्क के आधार पर) में सुधार हुआ है।

तकनीकी लाभ

  • एनकोडर-मुक्त एकीकृत आर्किटेक्चर: यह जेम्मा 4 12बी का मुख्य तकनीकी नवाचार है। पारंपरिक मल्टी-मोडल मॉडल (जैसे एलएलएवीए, क्वेन-वीएल) को एलएलएम में भेजने से पहले गैर-पाठ तौर-तरीकों को टोकन अनुक्रमों में परिवर्तित करने के लिए एलएलएम के सामने स्वतंत्र दृश्य एनकोडर (वीआईटी) और ऑडियो एनकोडर (व्हिस्पर इत्यादि) को कनेक्ट करने की आवश्यकता होती है। जेम्मा 4 12बी एनकोडर लिंक को हटाकर दृश्य और ऑडियो टोकननाइजेशन को सीधे एलएलएम के इनपुट प्रोजेक्शन परत में एकीकृत करता है। इस डिज़ाइन के प्रत्यक्ष लाभ हैं: (1) एनकोडर के कारण होने वाली सूचना बाधा को समाप्त करना - पारंपरिक वीआईटी का रिज़ॉल्यूशन और पैच आकार छवि विवरण की अवधारण को सीमित करता है, जेम्मा 4 12बी मूल रिज़ॉल्यूशन की अधिक जानकारी बनाए रख सकता है; (2) तौर-तरीकों के बीच संरेखण हानि को कम करना - एनकोडर द्वारा टोकन आउटपुट एलएलएम के शब्द एम्बेडिंग वितरण के साथ असंगत है, और एकीकृत टोकननाइजेशन इस बेमेल को समाप्त करता है; (3) अनुमान विलंब को कम करता है - एक कम एनकोडर अनुमान लिंक है। लागत यह है कि प्रशिक्षण चरण के लिए अधिक मल्टी-मोडल संरेखण डेटा और अधिक जटिल प्रशिक्षण रणनीतियों की आवश्यकता होती है, और मॉडल की दृश्य/ऑडियो गुणवत्ता सीधे एलएलएम बैकबोन की एम्बेडिंग क्षमता द्वारा सीमित होती है।
  • हार्डवेयर संगतता और अनुमान अनुकूलन: एक 12B डेंस मॉडल FP16 परिशुद्धता पर लगभग 24GB वीडियो मेमोरी लेता है और इसे 4-बिट परिमाणीकरण (जैसे AWQ/GPTQ) के साथ लगभग 7GB तक संपीड़ित किया जा सकता है, जिससे यह RTX 4060 (12GB) और Apple M-सीरीज़ चिप्स दोनों की एकीकृत मेमोरी पर चल सकता है। Google 30-50 टोकन/सेकेंड (4-बिट परिमाणीकरण, RTX 4090) तक की अनुमान गति के साथ, मूल TensorRT-LLM और ExecuTorch अनुकूलन पथ प्रदान करता है। MacOS संस्करण CoreML और Apple न्यूरल इंजन के माध्यम से और अधिक हार्डवेयर त्वरण प्रदान करता है।
  • एजेंट मूल समर्थन: मॉडल बाद में फाइन-ट्यूनिंग के माध्यम से इसे जोड़ने के बजाय, पूर्व-प्रशिक्षण चरण में टूल कॉल और संरचित आउटपुट प्रशिक्षण डेटा पेश करता है। इसका मतलब यह है कि फ़ंक्शन कॉलिंग और JSON संरचित आउटपुट पोस्ट-एपेंड समाधानों की तुलना में प्रारूप में अधिक स्थिर और सुसंगत हैं। मॉडल मूल रूप से समानांतर टूल कॉलिंग (समानांतर फ़ंक्शन कॉलिंग) का समर्थन करता है। एक एकल अनुमान एक ही समय में कई बाहरी उपकरणों (जैसे खोज + गणना + डेटाबेस) को कॉल कर सकता है।

क्वेरी), जो एजेंट वर्कफ़्लो निष्पादन की दक्षता के लिए महत्वपूर्ण है।

  • पारिस्थितिकी अनुकूलता: मॉडल वेट हगिंगफेस पर सेफटेन्सर्स प्रारूप में जारी किए जाते हैं, जो ट्रांसफॉर्मर, वीएलएलएम, एलएलएएमए.सीपीपी और ओलामा जैसे मुख्यधारा के अनुमान ढांचे के साथ संगत हैं। Google आधिकारिक तौर पर मॉडल डाउनलोड से लेकर अनुमान परिनियोजन (डॉकर छवि और कुबेरनेट्स हेल्म चार्ट सहित) तक एक संपूर्ण ट्यूटोरियल प्रदान करता है, साथ ही कोलाब और वर्टेक्स एआई के लिए एक-क्लिक क्लाउड परिनियोजन टेम्पलेट भी प्रदान करता है।

अनुकूलन सीमाएँ और प्रतिबंध

  • अनुशंसित उपयोग परिदृश्य: व्यक्तिगत डेवलपर्स और अकादमिक शोधकर्ताओं द्वारा स्थानीय मल्टी-मोडल प्रयोग (उपभोक्ता-ग्रेड जीपीयू पर चलाए जा सकते हैं); डेटा गोपनीयता-संवेदनशील परिदृश्यों में स्थानीय तर्क (चिकित्सा/कानूनी/वित्तीय दस्तावेज़ विश्लेषण); एजेंट/आरएजी सिस्टम के लिए स्थानीय परिनियोजन समाधान; मल्टी-मोडल लंबा संदर्भ विश्लेषण (लंबा वीडियो समझ, बहु-पृष्ठ दस्तावेज़ प्रश्नोत्तर, मीटिंग मिनट्स संश्लेषण)।
  • अनुशंसित नहीं: वास्तविक समय के इंटरैक्शन परिदृश्यों के लिए मिलीसेकंड-स्तर की प्रतिक्रिया की आवश्यकता होती है (स्थानीय तर्क का पहला टोकन विलंब 1-5 सेकंड के स्तर पर होता है); आउटपुट प्रारूप पर सख्त स्कीमा बाधाओं के साथ उत्पादन-स्तरीय डेटा पाइपलाइन (संरचित आउटपुट की स्थिरता को पूरी तरह से सत्यापित करने की आवश्यकता है); चिकित्सा निदान या कानूनी दस्तावेज़ निर्माण जिसके लिए अत्यधिक विश्वसनीयता की आवश्यकता होती है (बड़े मॉडलों की मतिभ्रम समस्या पूरी तरह से हल नहीं हुई है)।
  • ज्ञात सीमाएँ:
    • एनकोडर-रहित आर्किटेक्चर की दृश्य इनपुट गुणवत्ता एलएलएम एम्बेडिंग क्षमता द्वारा सीमित है, और अल्ट्रा-हाई-रिज़ॉल्यूशन छवियों (8K+) के विवरण को बनाए रखने की इसकी क्षमता एक समर्पित विज़ुअल मॉडल + एलएलएम के संयुक्त समाधान से कमजोर है।
    • हालांकि बहु-भाषा बेंचमार्क पर चीनी क्षमता में सुधार हुआ है, चीनी लेखन और सांस्कृतिक संदर्भ समझ की गुणवत्ता अभी भी उसी पैमाने के घरेलू ओपन सोर्स मॉडल (जैसे कि Qwen2.5-14B) से पीछे है।
    • ऑडियो इनपुट वर्तमान में केवल एकल चैनल (मोनो) का समर्थन करता है, और दोहरे चैनल/स्टीरियो दृश्यों के लिए डाउनमिक्स प्रोसेसिंग की आवश्यकता होती है।
    • macOS डेस्कटॉप ऐप केवल Apple सिलिकॉन (M1+) को सपोर्ट करता है, Intel Mac उपयोगकर्ताओं को कमांड लाइन संस्करण का उपयोग करने की आवश्यकता होती है।
    • सामुदायिक फाइन-ट्यूनिंग टूलचेन अभी तक परिपक्व नहीं है (जुलाई 2026 तक), आधिकारिक फाइन-ट्यूनिंग ट्यूटोरियल केवल लोरा को कवर करता है, और पूर्ण-पैरामीटर फाइन-ट्यूनिंग का संदर्भ कार्यान्वयन अभी भी विकास के अधीन है।

का उपयोग कैसे करें

प्रवेश कैसे उपयोग करें
macOS डेस्कटॉप एप्लिकेशन Google AI स्टूडियो आधिकारिक वेबसाइट डाउनलोड → इंस्टॉल करने के लिए डबल-क्लिक करें → स्वचालित मॉडल डाउनलोड → वार्तालाप मोड/फ़ाइल अपलोड
एपीआई इंटरफ़ेस (वर्टेक्स एआई) Google क्लाउड कंसोल API को सक्षम करता है → API कुंजी प्राप्त करें → REST API को कॉल करें
स्थानीय परिनियोजन (स्व-होस्टेड) ​​ हगिंगफेस-सीएलआई डाउनलोड गूगल/जेम्मा-4-12बी → वीएलएलएम/ओलामा लोडिंग → रेस्ट एपीआई सेवा
गूगल एआई स्टूडियो वेब अनुभव, किसी स्थानीय हार्डवेयर की आवश्यकता नहीं, मल्टी-मोडल इनपुट का समर्थन करता है लेकिन सर्वर कोटा द्वारा सीमित है

विशिष्ट एपीआई कॉल उदाहरण (पायथन + ओपनएआई संगत एसडीके):

ओपनएआई से ओपनएआई आयात करें

# वर्टेक्स एआई या स्व-तैनात एंडपॉइंट ओपनएआई संगत इंटरफेस के माध्यम से पहुंच योग्य हैं
क्लाइंट = ओपनएआई(
    बेस_यूआरएल = "http://localhost:8000/v1", # स्व-परिनियोजन वीएलएलएम समापन बिंदु
    api_key='<your_key>'
)

# मल्टी-मोडल इनपुट उदाहरण: छवि समझ + पाठ निर्देश
प्रतिक्रिया = client.chat.completions.create(
    मॉडल='गूगल/जेम्मा-4-12बी',
    संदेश=[
        {
            "भूमिका": "उपयोगकर्ता",
            "सामग्री": [
                {"प्रकार": "पाठ", "पाठ": "कृपया इस चित्र में तकनीकी वास्तुकला का विस्तार से वर्णन करें और संभावित डिज़ाइन दोषों को इंगित करें"},
                {"प्रकार": "image_url", "image_url": {"url": "data:image/png;base64,..."}}
            ]
        }
    ],
    max_tokens=2048,
    तापमान=0.2
)
प्रिंट(प्रतिक्रिया.विकल्प[0].संदेश.सामग्री)

उत्पाद का मूल्य निर्धारण

बिलिंग आइटम कीमत
मॉडल लाइसेंस (स्व-तैनाती) $0 (अपाचे 2.0)
वर्टेक्स एआई एपीआई (वॉल्यूम के अनुसार) इनपुट $0.15/एम टोकन, आउटपुट $0.60/एम टोकन (संदर्भ मूल्य, वास्तविक समय पृष्ठ के अधीन)
वर्टेक्स एआई बैच अनुमान इनपुट $0.075/एम टोकन, आउटपुट $0.30/एम टोकन (50% छूट)
निःशुल्क क्रेडिट (एआई स्टूडियो) प्रति दिन 100 निष्कर्ष, प्रत्येक 4K संदर्भ तक

मूल्य निर्धारण की जानकारी Google क्लाउड वर्टेक्स एआई के आधिकारिक वास्तविक समय मूल्य निर्धारण पृष्ठ के अधीन है। स्व-परिनियोजन मोड में, केवल हार्डवेयर और बिजली की लागत वहन की जाती है।

अनुप्रयोग परिदृश्य

  • परिदृश्य 1: स्थानीय मल्टी-मोडल दस्तावेज़ विश्लेषण - विश्लेषक 50-पृष्ठ पीडीएफ (आरेख और एनोटेटेड स्क्रीनशॉट सहित) को सीधे मैकओएस डेस्कटॉप ऐप में खींचता है और मॉडल को "मुख्य तर्क निकालने और एक संरचित सारांश उत्पन्न करने" के लिए कहता है। जेम्मा 4 12बी 256K संदर्भ विंडो में एक ही बार में सब कुछ संसाधित करता है, ~30 सेकंड में सारांश आउटपुट करता है। इसके विपरीत, पारंपरिक पद्धति में टेक्स्ट निकालने के लिए ओसीआर की आवश्यकता होती है, फिर चार्ट का विश्लेषण करने के लिए एक स्वतंत्र छवि समझ मॉडल का उपयोग किया जाता है, और अंत में इसे मैन्युअल रूप से सारांशित किया जाता है, जिसमें कुल मिलाकर लगभग 1-2 घंटे लगते हैं। सत्यापन विधि: उद्धरण सटीकता और प्रमुख डेटा बिंदुओं की रिकॉल दर की पुष्टि करने के लिए आउटपुट सारांश पृष्ठ को पृष्ठ दर पृष्ठ जांचें।
  • परिदृश्य 2: एजेंट-संचालित कोड समीक्षा स्वचालन - स्व-परिनियोजन वातावरण में एक एजेंट वर्कफ़्लो बनाएं: जेम्मा 4 12बी एक अनुमान इंजन के रूप में कार्य करता है और "रीड डिफ → जोखिम पैटर्न की पहचान करें → समीक्षा राय उत्पन्न करें → पीआर में टिप्पणी करें" के चार-चरणीय ऑपरेशन को स्वचालित रूप से निष्पादित करने के लिए कोड वेयरहाउस के पीआर इवेंट ट्रिगरिंग के साथ सहयोग करता है। 12बी पैरामीटर आकार इसे सीआई/सीडी के बजट संसाधनों (4 वीसीपीयू + 16जीबी मेमोरी, कोई जीपीयू नहीं) पर सीपीयू मोड (~3-5 टोकन/सेकंड) में चलाने की अनुमति देता है और एकल पीआर समीक्षा (~200 लाइनों के अंतर) के लिए 3-5 मिनट में पूरा किया जा सकता है। सत्यापन विधि: परीक्षण गोदाम पर ज्ञात समस्याओं के 50 पीआर चलाएं, और पता लगाने की दर और झूठी सकारात्मक दर की गणना करें।
  • परिदृश्य 3: लंबी वीडियो सामग्री अनुक्रमण और पुनर्प्राप्ति - एक खंडित सूचकांक (टाइमस्टैम्प + प्रत्येक विषय + मुख्य स्क्रीनशॉट) उत्पन्न करने के लिए मॉडल में 1 घंटे का प्रशिक्षण वीडियो (ध्वनि स्पष्टीकरण और स्लाइड सहित) इनपुट करें। मॉडल एक ही अनुमान में ऑडियो ट्रांसक्रिप्शन और विज़ुअल सामग्री दोनों को संसाधित करता है, संरचित वीडियो अध्याय टैग आउटपुट करता है। सत्यापन विधि: 5 यादृच्छिक नमूनों की टाइमस्टैम्प सटीकता और सामग्री सारांश सटीकता की मैन्युअल रूप से तुलना करें।

लागू लोग

  • डेवलपर्स और एआई इंजीनियर: तकनीकी कर्मचारी जिन्हें एपीआई या स्थानीय तैनाती के माध्यम से उत्पाद एकीकरण की आवश्यकता होती है। ट्रांसफार्मर अनुकूलता और एजेंट क्षमताओं पर ध्यान दें।
  • अकादमिक शोधकर्ता: एनकोडर-रहित आर्किटेक्चर, मल्टी-मोडल संरेखण प्रौद्योगिकी रोडमैप और छोटे पैरामीटर मॉडल के साथ प्रदर्शन ट्रेड-ऑफ के मॉडल डिजाइन नवाचार पर ध्यान केंद्रित करें।
  • डेटा संवेदनशील उद्यम: अनुपालन आवश्यकताओं (चिकित्सा डेटा, वित्तीय डेटा, ग्राहक गोपनीयता) वाले संगठन जो अपना स्वयं का अनुमान बुनियादी ढांचा बनाना चाहते हैं। जेम्मा 4 12बी का अपाचे 2.0 लाइसेंस और मूल रूप से चलने की क्षमता मुख्य आकर्षण हैं।
  • प्रौद्योगिकी उत्साही: व्यक्तिगत उपयोगकर्ताओं के लिए जो उपभोक्ता-ग्रेड हार्डवेयर पर अत्याधुनिक मल्टी-मोडल मॉडल का अनुभव करना चाहते हैं, मैकओएस डेस्कटॉप एप्लिकेशन एक शून्य-सीमा प्रवेश प्रदान करता है।

प्रतिस्पर्धी उत्पादों की तुलना

तुलनात्मक आयाम जेम्मा 4 12बी क्वेन2.5-14बी-वीएल एलएलएवीए-1.6-13बी GPT-4o (संदर्भ)
वास्तु प्रकार कोडेरलेस एकीकरण स्टैंडअलोन वीआईटी एनकोडर स्टैंडअलोन क्लिप एनकोडर बंद स्रोत, वास्तुकला अज्ञात
पैरामीटर आकार 12बी सघन 14बी सघन 13बी सघन
प्रसंग लंबाई 256K 128K 8K 128K
मल्टी-मॉडल समर्थन पाठ+छवि+ऑडियो+वीडियो पाठ+छवि पाठ+छवि पाठ+छवि+ऑडियो+वीडियो
ओपन सोर्स लाइसेंस अपाचे 2.0 अपाचे 2.0 (बेसिक) अपाचे 2.0 बंद स्रोत
स्थानीय अनुमान के लिए न्यूनतम हार्डवेयर 16जीबी वीआरएएम/एम1+ 16जीबी 16जीबी वीआरएएम 16जीबी वीआरएएम उपलब्ध नहीं है
एजेंट मूल समर्थन हाँ (पूर्व प्रशिक्षित) हाँ (अतिरिक्त सुव्यवस्थित) नहीं हाँ
चीनी दक्षता अच्छा उत्कृष्ट औसत उत्कृष्ट
एपीआई मूल्य निर्धारण (संदर्भ) $0.15/$0.60 ¥0.5/¥0.8 (अलीबाबा क्लाउड) मुफ़्त स्व-तैनाती $2.50/$10.00

सारांश और आउटलुक

जेम्मा 4 12बी ओपन सोर्स मल्टी-मॉडल बड़े मॉडल के क्षेत्र में वास्तुशिल्प स्तर पर एक विभेदित समाधान प्रदान करता है। एनकोडर-रहित एकीकृत आर्किटेक्चर एक वृद्धिशील सुधार नहीं है, बल्कि "एक छोटा पैरामीटर मॉडल मल्टी-मोडैलिटी को अच्छी तरह से कैसे कर सकता है?" के मूल प्रश्न का एक मौलिक उत्तर है। इसका 12बी पैरामीटर + उपभोक्ता-ग्रेड जीपीयू निष्पादन क्षमता का संयोजन स्थानीय मल्टी-मोडल अनुमान को "प्रयोगशाला खिलौना" से "कार्यान्वयन योग्य उपकरण" में बदल देता है।

वर्तमान लाभ: (1) वास्तुशिल्प नवाचार द्वारा लाया गया क्रॉस-मोडल संरेखण दक्षता सुधार एक कठिन लाभ है; (2) अपाचे 2.0 लाइसेंस + स्थानीय चलने की क्षमता इसे डेटा-संवेदनशील परिदृश्यों में अपूरणीय बनाती है; (3) 256K पूर्ण-मोडल संदर्भ समान पैरामीटर स्केल स्तर पर अग्रणी स्थिति में है।

ज्ञात सीमाएँ: (1) सामुदायिक उपकरण श्रृंखला (फाइन-ट्यूनिंग फ्रेमवर्क, मात्रात्मक उपकरण, परिनियोजन टेम्पलेट) की परिपक्वता एलएलएएमए और क्वेन पारिस्थितिकी की तुलना में बहुत कम है; (2) हालाँकि चीनी भाषा की क्षमता पिछली पीढ़ी की तुलना में बेहतर है, फिर भी एक अंतर है, और घरेलू उपयोगकर्ताओं को स्वयं इसका मूल्यांकन करने की आवश्यकता है; (3) लंबे संदर्भ परिदृश्यों में "ध्यान हानि" की समस्या पूरी तरह से हल नहीं हुई है, और व्यावहारिक अनुप्रयोगों में आउटपुट गुणवत्ता सत्यापन तंत्र स्थापित करने की आवश्यकता है।

अनुवर्ती ध्यान निर्देश: (1) समुदाय-व्युत्पन्न मॉडल (ठीक-ट्यून किए गए संस्करण, मात्रात्मक संस्करण, डोमेन-विशिष्ट संस्करण) के उद्भव की गति और गुणवत्ता - यह पारिस्थितिक स्वास्थ्य का प्रत्यक्ष संकेतक है; (2) जेम्मा 4 श्रृंखला के लिए Google की अद्यतन आवृत्ति और पैच समर्थन चक्र; (3) क्या एनकोडर-रहित आर्किटेक्चर का पालन अन्य मॉडल परिवारों (जैसे एलएलएएमए, क्वेन) द्वारा किया जाएगा, जो कि जेम्मा 4 12बी की दीर्घकालिक तकनीकी सड़क प्रतिस्पर्धात्मकता से संबंधित है।

यह अनुशंसा की जाती है कि संभावित उपयोगकर्ता इसे उत्पादन वातावरण में रखना है या नहीं, यह निर्णय लेने से पहले, आउटपुट गुणवत्ता की स्थिरता, अनुमान गति की स्वीकार्यता और लंबे-संदर्भ परिदृश्यों की सूचना याद दर पर ध्यान केंद्रित करते हुए, मैकओएस डेस्कटॉप एप्लिकेशन या Google एआई स्टूडियो फ्री कोटा के माध्यम से अपने स्वयं के परिदृश्यों में 1-2 सप्ताह का परीक्षण और सत्यापन करें।

संबंधित टूल: <एक्सलिंक टाइप='टूल' स्लग='हगिंग-फेस'>, <एक्सलिंक टाइप='टूल' स्लग='रेप्लिकेट'>

संस्करण जानकारी

  • जेम्मा 4 12बी आधिकारिक संस्करण :Google का ओपन सोर्स मल्टी-मॉडल बड़ा मॉडल एनकोडर के बिना एकीकृत आर्किटेक्चर को अपनाता है। 12बी पैरामीटर टेक्स्ट/छवि/ऑडियो/वीडियो समझ और एजेंट तर्क का समर्थन करते हैं। अपाचे 2.0 लाइसेंस.
  • जेम्मा 4 श्रृंखला जारी की गई :जेम्मा 4 श्रृंखला 12बी डेंस और 31बी डेंस/एमओई संस्करणों के साथ शुरू हुई।

उपयोगकर्ता समीक्षाएं

  • समीक्षाएं लोड हो रही हैं...