ओलामा स्थानीय बड़े मॉडल परिनियोजन और अनुप्रयोग समाधान

🛒 डेवलपर्स और उद्यमों के लिए ओलामा के स्थानीय बड़े मॉडल परिनियोजन समाधान में एक-क्लिक इंस्टॉलेशन और संचालन, मॉडल प्रबंधन, एपीआई एकीकरण, ओपनवेबयूआई विज़ुअलाइज़ेशन, मल्टी-मॉडल स्विचिंग, निजीकृत डेटा सुरक्षा और प्रदर्शन अनुकूलन, ऑफ़लाइन और निजी एआई क्षमताओं को साकार करने जैसे मुख्य परिदृश्य शामिल हैं।

ओलामा स्थानीय बड़े मॉडल परिनियोजन और अनुप्रयोग समाधान

समाधान सिंहावलोकन

हालाँकि बड़े भाषा मॉडल के लिए क्लाउड एपीआई कॉल सुविधाजनक हैं, लेकिन उनकी दीर्घकालिक लागत, अनियंत्रित डेटा गोपनीयता, नेटवर्क विलंबता और सीमित बैंडविड्थ है। गोपनीयता-संवेदनशील व्यवसायों, ऑफ़लाइन विकास परिवेशों और उच्च-आवृत्ति अनुमान परिदृश्यों के लिए, स्थानीय तैनाती ही एकमात्र व्यावहारिक विकल्प है।

यह समाधान पर्यावरण स्थापना, मॉडल प्रबंधन, एपीआई एकीकरण से लेकर विज़ुअल इंटरफ़ेस तक संपूर्ण स्थानीय एलएलएम वर्कफ़्लो बनाने के लिए कोर इंजन के रूप में Ollama का उपयोग करता है। समाधान macOS, Windows और Linux के तीन प्रमुख प्लेटफार्मों को कवर करता है, DeepSeek, Qwen जैसे मुख्यधारा के ओपन सोर्स मॉडल का समर्थन करता है, और पूर्ण ऑफ़लाइन AI क्षमताओं और निजीकरण को प्राप्त करने के लिए OpenAI API के साथ संगत एक एकीकरण इंटरफ़ेस प्रदान करता है। डेटा.

लक्षित उपयोगकर्ता: बैक-एंड डेवलपमेंट इंजीनियर, एआई एप्लिकेशन डेवलपर्स, डेटा वैज्ञानिक, संचालन और रखरखाव इंजीनियर, उच्च गोपनीयता अनुपालन आवश्यकताओं वाली कॉर्पोरेट टीमें, और व्यक्तिगत डेवलपर्स जिन्हें ऑफ़लाइन विकास वातावरण की आवश्यकता होती है।

मुख्य लाभ:

  • जीडीपीआर और व्यक्तिगत सूचना संरक्षण अधिनियम जैसी गोपनीयता अनुपालन आवश्यकताओं को पूरा करने के लिए डेटा शून्य-आउटपुट डिवाइस
  • टोकन द्वारा बिल किए गए एपीआई कॉल की लागत को खत्म करने से, बड़ी मात्रा में अनुमान परिदृश्यों की सीमांत लागत शून्य के करीब पहुंच जाती है
  • शून्य नेटवर्क विलंब, अनुमान गति केवल स्थानीय हार्डवेयर द्वारा सीमित है, जो वास्तविक समय के इंटरैक्टिव अनुप्रयोगों के लिए उपयुक्त है
  • दर्जनों ओपन सोर्स मॉडल के एक-क्लिक स्विचिंग का समर्थन करता है, कार्यों के अनुसार विभिन्न आकारों के मॉडल का चयन करता है, और लचीले ढंग से गुणवत्ता और गति को संतुलित करता है

आवश्यकताएँ:

  • पर्याप्त वीडियो मेमोरी वाला कंप्यूटर (Apple सिलिकॉन मैक शुरू करने के लिए 16GB एकीकृत मेमोरी की सिफारिश करता है; PC/NVIDIA RTX 3060 12GB या उच्चतर की सिफारिश करता है)
  • स्थिर नेटवर्क वातावरण (पहली बार मॉडल वेट डाउनलोड करने के लिए आवश्यक)
  • बुनियादी टर्मिनल कमांड लाइन संचालन क्षमताएं

टूलचेन अवलोकन

उपकरण उपयोग लागत प्लेटफार्म
<एक्सलिंक प्रकार='टूल' स्लग='ओलामा' नाम='ओलामा'> नेटिव एलएलएम रनटाइम इंजन (कोर) खुला स्रोत और मुफ़्त मैकओएस / विंडोज / लिनक्स
OpenAI API एपीआई संगतता मानक (डॉकिंग संदर्भ) भुगतान-जैसी-जैसी बिलिंग (तुलना के लिए) एपीआई
वेबयूआई खोलें ओलामा विज़ुअल चैट इंटरफ़ेस खुला स्रोत और मुफ़्त डॉकर/स्थानीय
ओलामा सीएलआई कमांड लाइन मॉडल प्रबंधन अंतर्निर्मित पूर्ण मंच
LM Studio विकल्प (जीयूआई पहले) खुला स्रोत और मुफ़्त मैकओएस / विंडोज / लिनक्स

चरण-दर-चरण मार्गदर्शिका

चरण 1: ओलामा स्थापना और पर्यावरण सत्यापन

⏱अनुमानित समय: 15-30 मिनट 🎯लक्ष्य: ओलामा इंस्टॉलेशन पूरा करें और बुनियादी ऑपरेटिंग क्षमताओं को सत्यापित करें ⚠️आवश्यकताएँ: कोई नहीं

1.1 ओलामा स्थापित करें

ऑपरेटिंग सिस्टम के अनुसार इंस्टॉलेशन विधि चुनें:

macOS: ollama.com से .dmg इंस्टॉलेशन पैकेज डाउनलोड करें, इसे एप्लिकेशन निर्देशिका में खींचें और इसे प्रारंभ करें। ओलामा स्वचालित रूप से मेनू बार में चलेगा।

विंडोज़: आधिकारिक वेबसाइट से इंस्टॉलेशन प्रोग्राम (.exe) डाउनलोड करें और इंस्टॉलेशन पूरा करने के लिए विज़ार्ड का पालन करें। इंस्टॉलेशन पूरा होने के बाद, ओलामा स्वचालित रूप से पृष्ठभूमि सेवा के रूप में प्रारंभ हो जाता है।

लिनक्स:

कर्ल -fsSL https://ollama.com/install.sh | श

इंस्टॉलेशन स्क्रिप्ट स्वचालित रूप से वितरण का पता लगाती है और सिस्टमडी सेवा को कॉन्फ़िगर करती है।

1.2 स्थापना सत्यापित करें

एक टर्मिनल खोलें और निष्पादित करें:

ओलामा--संस्करण

अपेक्षित आउटपुट ओलामा संस्करण 0.30.4 के समान है। दोबारा स्वास्थ्य जांच कराएं:

ओलामा सेवा

सेवा डिफ़ॉल्ट रूप से 127.0.0.1:11434 सुनती है, और सेवा प्रतिक्रिया की पुष्टि कर्ल http://localhost:11434 के माध्यम से की जा सकती है।

1.3 अभिगम नियंत्रण जाँच

  • [ ] ollama --version त्रुटियों के बिना संस्करण संख्या प्रिंट करें
  • [ ] कर्ल http://localhost:11434 HTTP 200 लौटाता है
  • [ ] लॉग में कोई पोर्ट व्यवसाय या अनुमति त्रुटियाँ नहीं

मॉडल को सीधे चलाने के बजाय पर्यावरण को सत्यापित करने का पहला कदम क्यों है? पहले पुष्टि करें कि इंजन स्वयं ठीक से काम कर रहा है, जो इंस्टॉलेशन समस्याओं और मॉडल समस्याओं को अलग कर सकता है ताकि वे बाद की समस्या निवारण के दौरान एक-दूसरे के साथ हस्तक्षेप न करें।


चरण 2: मॉडल डाउनलोड और पहला अनुमान

⏱ अनुमानित समय: 10-40 मिनट (मॉडल आकार और बैंडविड्थ के आधार पर) 🎯लक्ष्य: कम से कम एक ओपन सोर्स मॉडल खींचें और पहला संवाद निष्कर्ष पूरा करें ⚠️ पूर्वावश्यकता: ओलामा सेवा सामान्य रूप से चल रही है

2.1 हार्डवेयर कॉन्फ़िगरेशन के अनुसार मॉडल का चयन करें

विभिन्न हार्डवेयर स्केल चलाने योग्य मॉडल पैरामीटर स्तर निर्धारित करते हैं:

हार्डवेयर कॉन्फ़िगरेशन अनुशंसित मॉडल वीडियो मेमोरी आवश्यकताएँ परिमाणीकरण प्रारूप
एप्पल सिलिकॉन 8जीबी क्वेन2.5:0.5बी / लामा 3.2:1बी / डीपसीक-आर1:1.5बी ~1-2जीबी Q4_K_M
एप्पल सिलिकॉन 16जीबी/आरटीएक्स 3060 12जीबी क्वेन2.5:7बी / डीपसीक-आर1:7बी / लामा 3.1:8बी ~4-6जीबी Q4_K_M
Apple सिलिकॉन 32GB+ / RTX 4090 24GB क्वेन2.5:32बी / डीपसीक-आर1:32बी / लामा 3.3:70बी ~12-20जीबी Q4_K_M
मल्टी-कार्ड/डेटा सेंटर ग्रेड क्वेन2.5:72बी / डीपसीक-वी3 / लामा 3.1:405बी 40जीबी+ Q4_K_M / Q8_0

2.2 पुल मॉडल

उदाहरण के तौर पर Qwen2.5 7B लें:

ओलामा पुल क्वेन2.5:7बी

ओलामा स्वचालित रूप से परिमाणित मॉडल भार डाउनलोड करता है, और प्रगति पट्टी डाउनलोड प्रतिशत और गति प्रदर्शित करती है। पूरा होने के बाद, मॉडल को स्थानीय ~/.ollama/models/ निर्देशिका में संग्रहीत किया जाता है।

अन्य आमतौर पर उपयोग किए जाने वाले मॉडल पुल कमांड:

ओलामा पुल डीपसीक-आर1:7बी # डीपसीक आर1 7बी
ओलामा पुल लामा3.1:8बी # लामा 3.1 8बी
ओलामा पुल मिस्ट्रल:7बी #मिस्ट्रल 7बी
ओलामा पुल जेम्मा2:9बी # जेम्मा 2 9बी
ओलामा पुल qwen2.5:32b # Qwen2.5 32B (बड़ी वीडियो मेमोरी की आवश्यकता है)

2.3 रन अनुमान

पुल पूरा होने के बाद, आप ऑफ़लाइन अनुमान लगा सकते हैं:

ओलामा रन क्वेन2.5:7बी

इंटरैक्टिव संवाद इंटरफ़ेस दर्ज करें और मॉडल प्रतिक्रिया प्राप्त करने के लिए एक प्रश्न दर्ज करें। पहली लोडिंग में कुछ सेकंड से लेकर दस सेकंड से अधिक समय लगता है (मॉडल को वीडियो मेमोरी में लोड किया जाता है), और बाद की बातचीत वास्तविक समय स्ट्रीमिंग में आउटपुट होती है।

किसी वार्तालाप से बाहर निकलने के लिए /bye या Ctrl+C का उपयोग करें।

2.4 अभिगम नियंत्रण जांच

  • [ ] ओलामा सूची डाउनलोड किए गए मॉडलों को सूचीबद्ध कर सकती है, आकार अपेक्षाओं के अनुरूप है
  • [ ] ओलामा रन वार्तालाप मोड में प्रवेश करता है और सामान्य रूप से उत्तर दे सकता है
  • [ ] नेटवर्क से डिस्कनेक्ट होने के बाद भी सामान्य तर्क-वितर्क किया जा सकता है (ऑफ़लाइन क्षमताओं को सत्यापित करने के लिए)

विशेषज्ञ दृष्टिकोण: पहले चरण के रूप में 7बी स्तर मॉडल को खींचने की अनुशंसा की जाती है। यह अधिकांश आधुनिक हार्डवेयर पर आसानी से चल सकता है और डिबगिंग और सत्यापन के लिए सबसे अच्छा प्रारंभिक बिंदु है। हालाँकि 32B+ मॉडल उच्च गुणवत्ता का है, लेकिन इसकी मेमोरी आवश्यकताओं में नाटकीय रूप से वृद्धि हुई है। पहले अनुभव के लिए सीमा बहुत ऊंची न रखें।


चरण 3: ओपनएआई संगत एपीआई एकीकरण

⏱अनुमानित समय: 30-60 मिनट 🎯लक्ष्य: ओलामा के ओपनएआई संगत एपीआई एंडपॉइंट के माध्यम से देशी मॉडल को तीसरे पक्ष के अनुप्रयोगों में एकीकृत करें ⚠️पूर्व शर्त: कम से कम एक मॉडल सामान्य रूप से चल रहा है

3.1 एपीआई समापन बिंदु विवरण

ओलामा स्टार्टअप के बाद स्वचालित रूप से HTTP एपीआई को उजागर करता है, और डिफ़ॉल्ट पता http://localhost:11434 है। यह OpenAI API प्रारूप के साथ संगत है, इसलिए OpenAI के लिए लिखे गए अधिकांश SDK और लाइब्रेरी को बिना किसी संशोधन के जोड़ा जा सकता है।

कोर समापन बिंदु:

  • POST /v1/chat/completions - बातचीत पूर्णता
  • POST /v1/completions - पाठ पूर्णता (कुछ मॉडलों द्वारा समर्थित)
  • POST /v1/embeddings - टेक्स्ट एम्बेडिंग
  • GET /v1/models - उपलब्ध मॉडलों की सूची बनाएं

3.2 एपीआई कनेक्शन कॉन्फ़िगर करें

कर्ल टेस्ट:

कर्ल http://localhost:11434/v1/chat/completions \
  -एच "सामग्री-प्रकार: एप्लिकेशन/जेसन" \
  -डी '{
    "मॉडल": "qwen2.5:7b",
    "संदेश": [{"भूमिका": "उपयोगकर्ता", "सामग्री": "हैलो, कृपया चीनी भाषा में उत्तर दें: वेक्टर डेटाबेस क्या है?"}],
    "स्ट्रीम": गलत
  }'

पायथन क्लाइंट उदाहरण:

ओपनएआई से ओपनएआई आयात करें

क्लाइंट = ओपनएआई(
    बेस_यूआरएल = "http://localhost:11434/v1",
    api_key='ollama' # ओलामा एपीआई कुंजी को सत्यापित नहीं करता है, लेकिन फ़ील्ड को गैर-रिक्त रखने की आवश्यकता है
)

प्रतिक्रिया = client.chat.completions.create(
    मॉडल = "qwen2.5:7b",
    messages=[{"भूमिका": "उपयोगकर्ता", "सामग्री": "कुबेरनेट्स को तीन वाक्यों में समझाएं"}],
    तापमान=0.7,
    max_tokens=512
)

प्रिंट(प्रतिक्रिया.विकल्प[0].संदेश.सामग्री)

नोड.जेएस उदाहरण:

'ओपनाई' से ओपनएआई आयात करें;

स्थिरांक ग्राहक = नया OpenAI({
  बेसयूआरएल: 'http://localhost:11434/v1',
  एपीकी: 'ओलामा'
});

स्थिरांक प्रतिक्रिया = प्रतीक्षा करें client.chat.completions.create({
  मॉडल: 'डीपसीक-आर1:7बी',
  संदेश: [{भूमिका: 'उपयोगकर्ता', सामग्री: 'माइक्रोसर्विसेज को सरल शब्दों में समझाएं।' }],
  तापमान: 0.6
});

कंसोल.लॉग(प्रतिक्रिया.चॉइस[0].message.content);

3.3 सामान्य एकीकरण परिदृश्य

परिदृश्य 1: चैटजीपीटी/क्लाउड को विकास सहायक के रूप में बदलें वीएस कोड एक्सटेंशन जैसे कंटिन्यू.डेव और कोडजीपीटी में, एपीआई प्रदाता को ओलामा एंडपॉइंट + स्थानीय मॉडल स्लग के रूप में कॉन्फ़िगर करके, कोड पूर्णता और संवाद क्षमताओं को पूरी तरह से स्थानीयकृत किया जा सकता है।

परिदृश्य 2: एक स्थानीय एआई ग्राहक सेवा/दस्तावेज़ प्रश्नोत्तर प्रणाली बनाएं ओलामा एपीआई को लैंगचेन या लामाइंडेक्स वर्कफ़्लो से कनेक्ट करें, स्थानीय वेक्टर डेटाबेस (जैसे क्रोमा, मिल्वस) के साथ आरएजी लागू करें, और पूरी तरह से ऑफ़लाइन दस्तावेज़ प्रश्न और उत्तर प्रणाली बनाएं।

परिदृश्य 3: बैच टेक्स्ट प्रोसेसिंग पाइपलाइन फ़ाइल सूची को पार करने के लिए पायथन या शेल स्क्रिप्ट का उपयोग करें, एपीआई के माध्यम से एक-एक करके या बैचों में अनुमान अनुरोध भेजें, और प्रसंस्करण के बाद उन्हें निर्दिष्ट निर्देशिका में आउटपुट करें। यह परिदृश्य स्थानीय परिनियोजन के लागत लाभ को सर्वोत्तम रूप से दर्शाता है - शून्य सीमांत लागत पर लाखों टोकन अनुमान।

3.4 अभिगम नियंत्रण जांच

  • [ ] कर्ल परीक्षण गैर-रिक्त JSON लौटाता है जिसमें choices[0].message.content होता है
  • [ ] Python/Node.js SDK स्क्रिप्ट सामान्य रूप से उत्तर प्राप्त कर सकती है
  • [ ] पुष्टि करें कि एपीआई कुंजी को खाली स्ट्रिंग में बदलते समय कनेक्शन अभी भी सामान्य है (सत्यापित करें कि ओलामा कुंजी की जांच नहीं करता है)

चरण 4: WebUI विज़ुअल परिनियोजन खोलें

⏱अनुमानित समय: 30-60 मिनट 🎯लक्ष्य: ओपन वेबयूआई के माध्यम से ब्राउज़र-साइड चैटजीपीटी-शैली चैट इंटरफ़ेस प्रदान करें ⚠️ आवश्यक शर्तें: ओलामा सामान्य रूप से चल रहा है और कम से कम एक मॉडल उपलब्ध है

4.1 डॉकर परिनियोजन (अनुशंसित)

डॉकर रन -डी -पी 3000:8080 \
  --add-host=host.docker.internal:host-gateway \
  -v ओपन-वेबुई:/ऐप/बैकएंड/डेटा \
  --नाम खुला-वेबुई \
  --हमेशा पुनरारंभ करें \
  ghcr.io/open-webui/open-webui:main

http://localhost:3000 पर जाएं और अपना पहला खाता पंजीकृत करें (आप स्वचालित रूप से व्यवस्थापक बन जाएंगे)।

--add-host=host.docker.internal:host-gateway कंटेनर को होस्ट की ओलामा सेवा (http://host.docker.internal:11434) तक पहुंचने की अनुमति देता है। विंडोज़/मैकओएस डॉकर डेस्कटॉप के तहत डिफ़ॉल्ट रूप से उपलब्ध, लिनक्स को होस्ट-गेटवे समर्थन की पुष्टि करने की आवश्यकता है।

4.2 गैर-डॉकर स्थापना

#पायथन तरीका
गिट क्लोन https://github.com/open-webui/open-webui.git
सीडी ओपन-वेबुई
पिप इंस्टॉल -आर आवश्यकताएँ.txt
Pythonapp.py

4.3 कनेक्शन कॉन्फ़िगरेशन

वेबयूआई सेटिंग्स खोलें:

  • ओलामा बेस यूआरएल: http://host.docker.internal:11434 (डॉकर परिनियोजन) या http://127.0.0.1:11434 (गैर-डॉकर)
  • सिस्टम स्वचालित रूप से सभी डाउनलोड किए गए मॉडलों को खोजेगा और सूचीबद्ध करेगा
  • वार्तालाप इतिहास प्रबंधन, शीघ्र टेम्पलेट, दस्तावेज़ अपलोड (आरएजी), मॉडल पैरामीटर समायोजन और बहु-सत्र स्विचिंग का समर्थन करता है

4.4 अभिगम नियंत्रण जांच

  • [ ] ब्राउज़र एक्सेस http://localhost:3000 लॉगिन/पंजीकरण पृष्ठ को लोड कर सकता है
  • [ ] पंजीकरण के बाद, आप डाउनलोड किए गए मॉडल को मॉडल चयन ड्रॉप-डाउन में देख सकते हैं
  • [ ] सामान्य रूप से बातचीत शुरू कर सकते हैं और बिना किसी रुकावट के आउटपुट स्ट्रीम कर सकते हैं

विशेषज्ञ दृष्टिकोण: ओपन वेबयूआई की आवश्यकता नहीं है - एक शुद्ध सीएलआई या एपीआई पर्याप्त है। हालाँकि, टीम सहयोग परिदृश्यों में, विज़ुअल इंटरफ़ेस गैर-तकनीकी सदस्यों के लिए उपयोग सीमा को काफी कम कर देता है, और अंतर्निहित आरएजी फ़ाइल अपलोड फ़ंक्शन स्थानीय मॉडल को निजी दस्तावेज़ों के आधार पर प्रश्न और उत्तर करने में सक्षम बनाता है, जिसे सीएलआई मॉडल से बदलना मुश्किल है।


चरण 5: मल्टी-मॉडल स्विचिंग और ऑन-डिमांड शेड्यूलिंग

⏱ अनुमानित समय: 20-30 मिनट 🎯लक्ष्य: कार्य प्रकार के अनुसार स्वचालित रूप से या मैन्युअल रूप से स्विच करते हुए, एक ही वातावरण में विभिन्न आकारों के कई मॉडल तैनात करें ⚠️ आवश्यक शर्तें: चरण 2 पूरा करें और अलग-अलग परिमाण के कम से कम दो मॉडल रखें

5.1 मॉडल चयन रणनीति

कार्य प्रकार अनुशंसित मॉडल कारण
दैनिक कोड पूर्णता Qwen2.5-कोडर:7बी / डीपसीक-कोडर:6.7बी तेज गति, कोड विशेषज्ञता
जटिल तर्क विश्लेषण डीपसीक-आर1:32बी / क्यूवेन2.5:32बी मजबूत तर्क क्षमता
बहुभाषी अनुवाद क्वेन2.5:7बी / लामा 3.1:8बी सामान्य योग्यता संतुलन
टेक्स्ट एम्बेडिंग/वेक्टरीकरण llama3.2:1b/नोमिक-एम्बेड-टेक्स्ट हल्का, बैच प्रोसेसिंग के लिए उपयुक्त
सारांश/श्रेणी मिस्ट्रल:7बी तेजी से, निर्देशों का अच्छी तरह पालन करें

5.2 रनटाइम स्विचिंग

ओलामा बातचीत में सीधे मॉडल बदलने का समर्थन करता है। एपीआई को कॉल करते समय मॉडल पैरामीटर के माध्यम से निर्दिष्ट:

# बातचीत की शुरुआत में छोटे मॉडल का उपयोग करें और विश्लेषण के दौरान बड़े मॉडल पर स्विच करें
Small_model_response = client.chat.completions.create(
    मॉडल = "qwen2.5:7b",
    messages=[{"भूमिका": "उपयोगकर्ता", "सामग्री": "यह पाठ किस भाषा में है?"}]
)

# जटिल तर्क के दौरान मॉडल को बढ़ाएं
big_model_response = client.chat.completions.create(
    मॉडल = "qwen2.5:32b",
    messages=[{"भूमिका": "उपयोगकर्ता", "सामग्री": "इस कानून के अनुपालन जोखिमों का विश्लेषण करें..."}]
)

5.3 वीडियो मेमोरी प्रबंधन

अगली प्रतिक्रिया को तेज़ करने के लिए मॉडल सत्र समाप्त होने के बाद ओलामा मॉडल को डिफ़ॉल्ट रूप से वीडियो मेमोरी में बनाए रखता है। पर्यावरण चर के माध्यम से नियंत्रित किया जा सकता है:

#मॉडल अनलोडिंग टाइमआउट (सेकंड) सेट करें, और टाइमआउट के बाद स्वचालित रूप से वीडियो मेमोरी से अनलोड करें
OLLAMA_KEEP_ALIVE=300 निर्यात करें

# वीडियो मेमोरी को सेव करने के लिए प्रत्येक अनुमान के तुरंत बाद अनइंस्टॉल करने के लिए 0 पर सेट करें
OLLAMA_KEEP_ALIVE=0 निर्यात करें

# स्थायी निवासी वीडियो मेमोरी को इंगित करने के लिए -1 पर सेट करें
OLLAMA_KEEP_ALIVE=-1 निर्यात करें

5.4 अभिगम नियंत्रण जांच

  • [ ] एपीआई/सीएलआई और आउटपुट के माध्यम से सामान्य रूप से कम से कम दो अलग-अलग मॉडल स्विच करने में सक्षम
  • [ ] मॉडल स्विच करने के बाद देखने योग्य मेमोरी रिलीज़ और लोडिंग (एनवीडिया-एसएमआई या ऐप्पल एक्टिविटी मॉनिटर के माध्यम से)
  • [ ] OLLAMA_KEEP_ALIVE=0 सेट करने के बाद, वीडियो मेमोरी अनुमान के बाद जारी की जाती है।

चरण 6: निजीकृत डेटा सुरक्षा कॉन्फ़िगरेशन

⏱अनुमानित समय: 30-60 मिनट 🎯लक्ष्य: पुष्टि करें कि डेटा पूरी तरह से स्थानीयकृत है, नेटवर्क अलगाव और पहुंच नियंत्रण कॉन्फ़िगर करें ⚠️ पूर्वापेक्षाएँ: ओलामा परिनियोजन पूर्ण है और चल रहा है

6.1 डेटा स्थानीयता सत्यापित करें

सभी ओलामा डेटा स्थानीय निर्देशिकाओं में संग्रहीत है:

macOS/Linux: ~/.ollama/models/ विंडोज़: C:\Users\<username>\.ollama\models\

पुष्टि करें कि कोई आउटगोइंग ट्रैफ़िक नहीं है:

# macOS: ओलामा प्रक्रिया की नेटवर्क गतिविधि की जांच करने के लिए lsof का उपयोग करें
lsof -p $(pgrep ollama) -i

# या वायरशार्क/टीसीपीडम्प के माध्यम से लक्ष्य आईपी को फ़िल्टर करें
sudo tcpdump -i कोई होस्ट नहीं 127.0.0.1 और पोर्ट 11434

सामान्य परिस्थितियों में, ओलामा को स्थानीय लूपबैक और मॉडल डाउनलोड अवधि के अलावा नेटवर्क अनुरोध नहीं करना चाहिए।

6.2 नेटवर्क अलगाव कॉन्फ़िगर करें

केवल स्थानीय पहुंच (डिफ़ॉल्ट): ओलामा डिफ़ॉल्ट रूप से 127.0.0.1:11434 सुनता है, जो केवल इस मशीन तक पहुंच योग्य है। यह सबसे सुरक्षित कॉन्फ़िगरेशन है.

LAN साझाकरण (टीम के भीतर उपयोग के लिए):

निर्यात OLLAMA_HOST=0.0.0.0:11434
ओलामा सेवा

इस समय, LAN में अन्य उपकरणों को http://<your IP>:11434 के माध्यम से एक्सेस किया जा सकता है। स्रोत आईपी को सीमित करने के लिए फ़ायरवॉल नियमों के साथ सहयोग करने की अनुशंसा की जाती है

उत्पादन पर्यावरण सुरक्षा सुदृढीकरण:

  • सार्वजनिक नेटवर्क पोर्ट को उजागर किए बिना ओलामा को एक स्वतंत्र इंट्रानेट वीएलएएन या डॉकर कंटेनर में तैनात करें
  • फ्रंटएंड रिवर्स प्रॉक्सी (Nginx/Caddy) के माध्यम से HTTPS और बेसिक ऑथेंट जोड़ता है
  • डॉकर नेटवर्क आइसोलेशन का उपयोग करें: केवल ओपन वेबयूआई कंटेनर को ओलामा कंटेनर तक पहुंचने की अनुमति दें, सीधे बाहरी पहुंच को अवरुद्ध करें
# Nginx रिवर्स प्रॉक्सी उदाहरण
सर्वर {
    सुनो 443 एसएसएल;
    सर्वर_नाम ollama.internal.example.com;

    स्थान/{
        प्रॉक्सी_पास http://127.0.0.1:11434;
        प्रॉक्सी_सेट_हेडर होस्ट $ होस्ट;
        प्रॉक्सी_सेट_हेडर एक्स-रियल-आईपी $remote_addr;

        # सिंपल बेसिक ऑथ
        auth_basic "ओलामा एपीआई";
        auth_basic_user_file /etc/nginx/.htpasswd;
    }
}

6.3 डेटा बैकअप और पुनर्प्राप्ति

# संपूर्ण मॉडल संग्रहण निर्देशिका का बैकअप लें
tar -czf ollama-models-backup-$(date +%Y%m%d).tar.gz ~/.ollama/models/

# नए वातावरण में पुनर्स्थापित करें
tar -xzf ollama-models-backup-20260730.tar.gz -C ~/

6.4 अभिगम नियंत्रण जाँच

  • [ ] मॉडल अनुमान नेटवर्क बंद करने के बाद भी उपलब्ध है (पुष्टि करें कि कोई दूरस्थ निर्भरता नहीं है)
  • [] बाहरी नेटवर्क पोर्ट स्कैन यह पुष्टि करने के लिए कि ओलामा पोर्ट सार्वजनिक नेटवर्क के संपर्क में नहीं है
  • [ ] मॉडल निर्देशिका अखंडता: ~/.ollama/models/ सामग्री `ollama सूची' आउटपुट के अनुरूप है

चरण 7: प्रदर्शन अनुकूलन और संचालन और रखरखाव

⏱अनुमानित समय: 1-2 घंटे 🎯लक्ष्य: अनुमान प्रदर्शन को अनुकूलित करें, डिस्क स्थान प्रबंधित करें, और एक निगरानी तंत्र स्थापित करें ⚠️ आवश्यक शर्तें: ओलामा स्थिर रूप से चल रहा है

7.1 अनुमान प्रदर्शन ट्यूनिंग

समानांतर अनुरोध नियंत्रण:

# समवर्ती अनुरोधों की अधिकतम संख्या को नियंत्रित करें (डिफ़ॉल्ट 1, कुछ हार्डवेयर 2-4 सक्षम कर सकते हैं)
OLLAMA_NUM_PARALLEL=2 निर्यात करें

# लोड किए गए मॉडलों की अधिकतम संख्या को नियंत्रित करें (मेमोरी OOM से बचने के लिए)
OLLAMA_MAX_LOADED_MODELS=2 निर्यात करें

GPU त्वरण पुष्टिकरण:

ओलामा रन क्वेन2.5:7बी --वर्बोज़

यदि आउटपुट में llm_load_tensors: offloaded X/YY लेयर्स टू GPU या मेटल जैसे शब्द हैं, तो इसका मतलब है कि GPU त्वरण प्रभावी हो गया है।

मैकओएस मेटल एक्सेलेरेशन: मैकओएस के लिए ओलामा डिफ़ॉल्ट रूप से मेटल को सक्षम करता है। यदि सत्यापन आवश्यक है:

# जांचें कि क्या अनुमान लॉग में "धातु" शब्द है
ओलामा रन लामा3.2:1बी 2>&1 | ग्रेप-आई मेटल

7.2 डिस्क स्थान प्रबंधन

मॉडल वज़न सबसे अधिक जगह घेरते हैं। आवश्यकतानुसार सफाई करें:

# डाउनलोड किए गए मॉडल और आकार देखें
ओलामा सूची

# मॉडल हटाएं की अब आवश्यकता नहीं है
ओलामा आरएम क्वेन2.5:0.5बी

# मॉडल स्टोरेज डायरेक्टरी का आकार जांचें
डु -श ~/.ओलामा/मॉडल/

7.3 लॉगिंग और मॉनिटरिंग

# ओलामा सेवा लॉग
# macOS: कंसोल ऐप -> लॉग देखें -> ओलामा
# लिनक्स: जर्नलक्टल -यू ओलामा -एफ
# प्रत्यक्ष आउटपुट: ओलामा सर्व 2>&1

# एपीआई स्वास्थ्य निगरानी स्क्रिप्ट (प्रोमेथियस संग्रह के लिए इस्तेमाल किया जा सकता है)
कर्ल -s http://localhost:11434/api/tags | jq '.मॉडल | लंबाई'

7.4 अभिगम नियंत्रण जांच

  • [ ] समानांतर अनुरोधों के तहत तर्क में कोई OOM त्रुटि नहीं
  • [ ] ollama list द्वारा देखा गया डिस्क उपयोग वास्तविक du के अनुरूप है
  • [ ] किसी मॉडल को हटाने के बाद डिस्क स्थान सही ढंग से जारी किया जाता है

अपेक्षित परिणाम

डिलिवरेबल्स सूची

डिलिवरेबल्स विवरण स्वीकृति मानदंड
ओलामा ऑपरेटिंग वातावरण सर्वर इंस्टॉलेशन पूरा हो गया है और बूट पर स्वचालित रूप से प्रारंभ हो जाता है कर्ल लोकलहोस्ट:11434 200 लौटाता है
उपलब्ध मॉडल पूल विभिन्न परिमाण के कम से कम 2 मॉडल ओलामा सूची सूचियाँ > 1 मॉडल
एपीआई एकीकरण उदाहरण Python/Node.js क्लाइंट कॉल करने योग्य एसडीके स्क्रिप्ट वैध उत्तर देती है
वेबयूआई खोलें ब्राउज़र-साइड विज़ुअल इंटरफ़ेस पंजीकरण के बाद डायलॉग और आरएजी अपलोड उपलब्ध है
सुरक्षा सख्त समाधान नेटवर्क अलगाव + रिवर्स प्रॉक्सी कॉन्फ़िगरेशन सार्वजनिक नेटवर्क को ओलामा बंदरगाह से सीधे नहीं जोड़ा जा सकता
बैकअप और पुनर्प्राप्ति प्रक्रिया मॉडल निर्देशिका संग्रह स्क्रिप्ट पुनर्प्राप्ति के बाद सुसंगत ओलामा सूची

अपेक्षित परिणाम

मेट्रिक्स स्थानीय ओलामा तैनाती क्लाउड एपीआई समाधान
प्रतिक्रिया में देरी (पहला टोकन) 50-500ms (हार्डवेयर पर निर्भर करता है) 200-2000 एमएस (नेटवर्क सहित)
मिलियन टोकन अनुमान लागत केवल बिजली लागत (~$0.01-0.05) $5-15 (एपीआई द्वारा कीमत)
डेटा गोपनीयता स्तर पूर्णतः स्थानीय/शून्य रिसाव सेवा प्रदाता अनुपालन पर भरोसा
ऑफ़लाइन उपलब्ध है ✅ पूरी तरह से समर्थित ❌ इंटरनेट कनेक्शन आवश्यक
मॉडल वैकल्पिकता किसी भी ओपन सोर्स मॉडल का निःशुल्क स्विचिंग प्लेटफ़ॉर्म द्वारा प्रदान किए गए मॉडलों तक सीमित

अक्सर पूछे जाने वाले प्रश्न और समस्या निवारण

प्रश्न: स्थापना के बाद, ओलामा सर्व रिपोर्ट करता है कि पोर्ट 11434 पर कब्जा है? उ: जांचें कि क्या पहले से ही कोई ओलामा इंस्टेंस चल रहा है: पीजीआरईपी ओलामा। यदि है, तो इसे दोबारा शुरू करने की कोई आवश्यकता नहीं है; यदि इस पर अन्य एप्लिकेशन का कब्जा है, तो पोर्ट को संशोधित करें: export OLLAMA_HOST=127.0.0.1:11435 और फिर इसे फिर से शुरू करें।

प्रश्न: मॉडल खींचते समय डाउनलोड गति बेहद धीमी है या समय समाप्त हो गया है? उ: ओलामा डिफ़ॉल्ट रूप से गिटहब रिलीज़ और हगिंग फेस से मात्रात्मक भार खींचता है, और घरेलू नेटवर्क सीमित हो सकते हैं। समाधान: एक प्रॉक्सी का उपयोग करें (निर्यात http_proxy=...); या मिरर साइट से जीजीयूएफ फ़ाइल डाउनलोड करें और इसे मॉडलफाइल के माध्यम से आयात करें।

प्रश्न: धीमी संवाद प्रतिक्रिया/स्ट्रीमिंग आउटपुट में हकलाना? उ: जांचें कि क्या GPU त्वरण प्रभावी होता है। macOS मेटल सपोर्ट की पुष्टि करता है; NVIDIA CUDA ड्राइवर स्थापना की पुष्टि करता है; जब अपर्याप्त वीडियो मेमोरी होगी, तो मॉडल सीपीयू अनुमान पर वापस आ जाएगा, और गति काफी कम हो जाएगी। छोटे परिमाणीकरण प्रारूप या कम संख्या में पैरामीटर वाले मॉडल आज़माएं।

प्रश्न: अनुमान परिणामों की गुणवत्ता चैटजीपीटी/क्लाउड जितनी अच्छी नहीं है? उत्तर: स्थानीय 7बी-8बी मॉडल की व्यापक क्षमता वास्तव में ChatGPT या Claude के 100 बिलियन पैरामीटर मॉडल से कमजोर है। यह सामान्य आकार का अंतर है. कार्य के आधार पर एक मॉडल चुनने की अनुशंसा की जाती है: कोडिंग कार्यों के लिए कोड श्रृंखला के परिष्कृत संस्करण का उपयोग करें, गणितीय तर्क के लिए R1 श्रृंखला का उपयोग करें, और सामान्य प्रश्न और उत्तर के लिए 32B+ मॉडल का उपयोग करें। ऑन-प्रिमाइसेस परिनियोजन के लाभ गोपनीयता, लागत और अनुकूलनशीलता हैं, न कि पूर्ण गुणवत्ता।

प्रश्न: एक ही मशीन पर एकाधिक मॉडल कैसे चलाएं? उ: ओलामा समानांतर में कई मॉडल लोड करने का समर्थन करता है। OLLAMA_MAX_LOADED_MODELS के माध्यम से ऊपरी सीमा को नियंत्रित करें। लेकिन वीडियो मेमोरी की कुल मात्रा पर ध्यान दें - दो 7B मॉडल के लिए लगभग 8-12GB वीडियो मेमोरी की आवश्यकता होती है। हार्डवेयर के अनुसार उचित योजना बनाने की अनुशंसा की जाती है।

प्रश्न: एंटरप्राइज़ टीमें कई मशीनों में ओलामा इंस्टेंसेस का प्रबंधन कैसे करती हैं? ए: इसे एकीकृत कॉन्फ़िगरेशन प्रबंधन उपकरण (एन्सिबल/पपेट) के माध्यम से बैचों में तैनात किया जा सकता है; साझा भंडारण का उपयोग करें या मॉडल को पहले से डाउनलोड करें और फिर उसे वितरित करें; प्रत्येक सेवा को संबंधित ओलामा नोड के इंट्रानेट पते पर इंगित करने के लिए आंतरिक DNS का उपयोग करें। ओलामा को सार्वजनिक नेटवर्क पर उजागर करने की अनुशंसा नहीं की जाती है।

प्रश्न: ओपन वेबयूआई स्थापित करने के बाद डॉकर ओलामा से कनेक्ट नहीं हो सकता है? उ: सबसे आम कारण यह है कि --add-host कॉन्फ़िगर नहीं है या गलत तरीके से कॉन्फ़िगर किया गया है। पुष्टि करें: 1) क्या कर्ल होस्ट.डॉकर.इंटरनल:11434 डॉकर कंटेनर में पहुंच योग्य है; 2) लिनक्स पर डॉकर 20.04+ संस्करण डिफ़ॉल्ट रूप से होस्ट-गेटवे का समर्थन करता है। पुराने संस्करणों को मैन्युअल रूप से --add-host=host.docker.internal:$(ip रूट शो डिफॉल्ट | awk '{print $3}') जोड़ने की जरूरत है।


कार्यक्रम चक्र और निवेश

चरण समय लगने वाला भाग लेने वाली भूमिकाएँ आउटपुट
पर्यावरण सेटअप 0.5-1 दिन विकास/संचालन एवं रखरखाव स्टैंड-अलोन ओलामा दौड़ने के लिए तैयार
मॉडल परीक्षण एवं चयन 0.5-1 दिन एआई इंजीनियर स्थानीय हार्डवेयर के लिए उपयुक्त मॉडल संयोजन निर्धारित करें
एपीआई एकीकरण 0.5-1.5 दिन बैक-एंड विकास ओलामा एपीआई तक बिजनेस सिस्टम की पहुंच
दृश्य परिनियोजन 0.5 दिन विकास वेबयूआई ऑनलाइन खोलें
सुरक्षा कड़ी करना 0.5-1 दिन संचालन एवं रखरखाव नेटवर्क अलगाव और अभिगम नियंत्रण
प्रदर्शन ट्यूनिंग 0.5-1 दिन एआई इंजीनियर/संचालन एवं रखरखाव समवर्ती और कैश रणनीति कॉन्फ़िगरेशन

पहले कार्यान्वयन के लिए कुल चक्र: लगभग 3-6 दिन (यह मानते हुए कि एक व्यक्ति इससे परिचित है)।


फायदे और नुकसान का विश्लेषण

लाभ

  • शून्य एपीआई लागत: स्थानीय अनुमान के लिए कोई टोकन बिलिंग नहीं है, और बड़ी मात्रा वाले परिदृश्यों में सीमांत लागत शून्य के करीब पहुंच जाती है।
  • पूर्ण गोपनीयता: मॉडल और डेटा स्थानीय रहते हैं, किसी तीसरे पक्ष की पहुंच नहीं
  • ऑफ़लाइन उपलब्ध: कोई नेटवर्क निर्भरता नहीं, इंट्रानेट/बंद विकास वातावरण के लिए उपयुक्त
  • मॉडल स्वतंत्रता: आप इच्छानुसार ओपन सोर्स मॉडल को स्विच, फाइन-ट्यून और मर्ज कर सकते हैं
  • कम सीमा: एक-पंक्ति स्थापना, आप 15 मिनट में इसका उपयोग शुरू कर सकते हैं

सीमाएँ

  • हार्डवेयर आवश्यकताएँ: उच्च-गुणवत्ता वाले अनुमान के लिए एक बड़ी मेमोरी GPU की आवश्यकता होती है, और एक हार्डवेयर निवेश सीमा होती है (Apple सिलिकॉन 16GB का शुरुआती अनुभव बेहतर है)
  • मॉडल क्षमता ऊपरी सीमा: जो मॉडल स्थानीय हार्डवेयर पर चलाए जा सकते हैं वे आमतौर पर 7बी-32बी रेंज में होते हैं, और व्यापक क्षमताएं 100 बिलियन पैरामीटर क्लाउड मॉडल से कमजोर होती हैं
  • रखरखाव लागत: मल्टी-मॉडल प्रबंधन, डिस्क सफाई और संस्करण अपडेट के लिए मैन्युअल ध्यान देने की आवश्यकता होती है
  • पारिस्थितिक अंतर: कुछ बंद-स्रोत एपीआई विशेष फ़ंक्शन (नेटवर्क खोज, मल्टी-मोडल विश्लेषण, आदि) को स्थानीय रूप से पुन: प्रस्तुत नहीं किया जा सकता है

उपकरणों और संसाधनों का सारांश

कोर उपकरण

उपकरण भूमिकाएँ लिंक/संदर्भ
<एक्सलिंक प्रकार='टूल' स्लग='ओलामा' नाम='ओलामा'> स्थानीय एलएलएम रनटाइम इंजन एक्सलिंक प्रकार='टूल' स्लग='ओलामा'
OpenAI API एपीआई अनुपालन मानक `एक्सलिंक टाइप='टूल' स्लग='ओपनाई-एपीआई'
वेबयूआई खोलें विज़ुअल चैट इंटरफ़ेस ओपन सोर्स प्रोजेक्ट, GitHub
LM Studio वैकल्पिक (जीयूआई अनुभव) `एक्सलिंक प्रकार='टूल' स्लग='एलएम-स्टूडियो'

अनुशंसित ओपन सोर्स मॉडल

मॉडल लागू परिदृश्य ओलामा पुल कमांड
Qwen2.5 सार्वभौमिक संवाद/चीनी अनुकूलन ओलामा पुल क्वेन2.5:7बी
<एक्सलिंक प्रकार='टूल' स्लग='डीपसीक' नाम='डीपसीक-आर1'> तर्क/गणित/कोड ओलामा पुल डीपसीक-आर1:7बी
लामा 3.1 अंग्रेजी जनरल/कमांड फॉलो ओलामा पुल लामा3.1:8बी
मिस्ट्रल 7बी बहुभाषी/गति प्रथम ओलामा पुल मिस्ट्रल:7बी
जेम्मा 2 हल्का/गूगल-आधारित ओलामा पुल जेम्मा2:9बी

वैकल्पिक तुलना: ओलामा बनाम एलएम स्टूडियो

तुलना आइटम <एक्सलिंक प्रकार='टूल' स्लग='ओलामा' नाम='ओलामा'> LM Studio
स्थापना विधि सीएलआई + पृष्ठभूमि सेवा जीयूआई डेस्कटॉप एप्लिकेशन
आरंभ करने में कठिनाई ★★☆ (टर्मिनल की आवश्यकता है) ★☆☆ (बॉक्स से बाहर उपयोग के लिए तैयार)
एपीआई संगत OpenAI संगत (मुख्य कार्यक्षमता) OpenAI संगत (अधिक संपूर्ण)
मल्टी-मॉडल प्रबंधन सीएलआई आदेश जीयूआई मॉडल ब्राउज़र
प्रदर्शन तुलना समान समान
लागू परिदृश्य सर्वर परिनियोजन, एपीआई एकीकरण व्यक्तिगत डेस्कटॉप, परीक्षण पैरामीटर समायोजन

दोनों निचली परत पर अनुमान लागू करने के लिए llama.cpp का उपयोग करते हैं, और अनुमान प्रदर्शन लगभग समान है। चयन सुझाव: उन परिदृश्यों के लिए ओलामा चुनें जिनके लिए एपीआई सर्वर, सीआई/सीडी एकीकरण और रिमोट एक्सेस की आवश्यकता होती है; उन व्यक्तिगत उपयोगकर्ताओं के लिए एलएम स्टूडियो चुनें जो आउट-ऑफ़-द-बॉक्स जीयूआई अनुभव चाहते हैं।


दृश्यों को अपनाना और भीड़ को मोड़ना

इष्टतम परिदृश्य

दृश्य विवरण
गोपनीयता के प्रति संवेदनशील उद्यम वित्त, चिकित्सा, कानूनी और अन्य उद्योगों में, डेटा को इंटरनेट छोड़ना सख्त वर्जित है
ऑफ़लाइन/इंट्रानेट विकास वातावरण गोपनीय परियोजनाएं, इंटरनेट एक्सेस के बिना अनुसंधान एवं विकास वातावरण
उच्च-आवृत्ति बैच अनुमान बड़े पैमाने पर डेटा प्रोसेसिंग, सामग्री समीक्षा, पाठ वर्गीकरण, उच्च एपीआई लागत
व्यक्तिगत डेवलपर सीखना कम लागत पर ओपन सोर्स मॉडल का अनुभव करें, किसी सशुल्क एपीआई खाते की आवश्यकता नहीं है
टीम आंतरिक एआई सहायक एंटरप्राइज इंट्रानेट परिनियोजन, सभी कर्मचारियों के लिए निजीकृत एलएलएम उपलब्ध

दृश्य के लिए उपयुक्त नहीं है

  • ऐसे परिदृश्य जिनमें इंटरनेट खोज क्षमताओं की आवश्यकता होती है: स्थानीय मॉडल में स्वयं वास्तविक समय नेटवर्किंग क्षमताएं नहीं होती हैं, और अतिरिक्त खोज मिडलवेयर को एकीकृत करने की आवश्यकता होती है।
  • उत्पादन अनुमान के लिए मिलीसेकंड-स्तरीय विलंबता की आवश्यकता होती है: स्थानीय मॉडल का पहला टोकन विलंब वीडियो मेमोरी लोडिंग गति (आमतौर पर 50-500ms) द्वारा सीमित होता है, जो क्लाउड एपीआई की प्रीलोडिंग सेवा की तुलना में बहुत धीमी है
  • मल्टी-मोडल (छवि/भाषण/वीडियो) तर्क आवश्यकताएँ: ओलामा का दृश्य/भाषण मॉडल समर्थन सीमित है और वाणिज्यिक एपीआई की तुलना में बहुत कम परिपक्व है
  • अपर्याप्त कंप्यूटिंग शक्ति वाला पुराना हार्डवेयर: 4GB से कम की वीडियो मेमोरी या 8GB से कम की Apple सिलिकॉन केवल 1B-3B छोटे मॉडल चला सकती है, वास्तविक उपलब्धता सीमित है

उपयोगकर्ता समीक्षाएं

  • समीक्षाएं लोड हो रही हैं...