डिवाइस-साइड एआई और एआई पीसी/एआई फोन कार्यान्वयन समाधान

🛒 डेवलपर्स और अंतिम उपयोगकर्ताओं के लिए एंड-साइड एआई कार्यान्वयन समाधान एआई पीसी/एआई फोन स्थानीय बड़े मॉडल परिनियोजन, एनपीयू त्वरित अनुमान, एंड-साइड एप्लिकेशन विकास और गोपनीयता कंप्यूटिंग, ऑफ़लाइन और निजी एआई क्षमताओं को साकार करने को कवर करता है।

डिवाइस-साइड एआई और एआई पीसी/एआई फोन कार्यान्वयन समाधान

समाधान सिंहावलोकन

यह समाधान डिवाइस-साइड एआई परिनियोजन और स्थानीय एआई एप्लिकेशन विकास परिदृश्यों पर केंद्रित है, जो एआई पीसी और एआई फोन के दो टर्मिनल रूपों को कवर करता है, जिससे डेवलपर्स और तकनीकी टीमों को बड़े भाषा मॉडल और संबंधित एआई क्षमताओं को सीधे उपयोगकर्ता उपकरणों पर चलाने में मदद मिलती है। स्थानीय तर्क के माध्यम से, यह डिवाइस से डेटा छोड़े बिना गोपनीयता सुरक्षा, नेटवर्क निर्भरता के बिना ऑफ़लाइन उपलब्धता और क्लाउड एपीआई कॉल लागत को कम करते हुए मिलीसेकंड-स्तर की कम-विलंबता प्रतिक्रिया प्राप्त करता है।

मुख्य उपकरण श्रृंखला में शामिल हैं: , , , , <exlink टाइप = "टूल" स्लग = "चैटजीपीटी" नाम = "चैटजीपीटी">, <एक्सलिंक टाइप = "टूल" स्लग = "क्लाउड" नाम = "क्लाउड">, <एक्सलिंक टाइप = "टूल" स्लग = "डीपसीक" नाम = "डीपसीक">, साथ ही एंड-साइड रीजनिंग फ्रेमवर्क और प्लेटफ़ॉर्म क्षमताएं जैसे कि llama.cpp और Apple Intelligence।

लक्षित उपयोगकर्ता: क्लाइंट-साइड एआई एप्लिकेशन डेवलपर्स, एआई पीसी/फोन उत्पाद प्रबंधक, गोपनीयता कंप्यूटिंग इंजीनियर और एंटरप्राइज आईटी आर्किटेक्ट।

आवश्यकताएँ:

  • बुनियादी कमांड लाइन संचालन क्षमताएं हों (मैकओएस/लिनक्स/विंडोज)
  • एक AI पीसी हो जो NPU या स्वतंत्र GPU (Apple सिलिकॉन, क्वालकॉम स्नैपड्रैगन
  • मॉडल परिमाणीकरण और अनुमान ढांचे जैसी बुनियादी अवधारणाओं को समझें
  • पायथन और एपीआई एकीकृत विकास की मूल बातें

टूलचेन सूची

उपकरण उद्देश्य आवश्यक खाता स्तर अनुमानित फीस विकल्प
<एक्सलिंक प्रकार='टूल' स्लग='ओलामा' नाम='ओलामा'> स्थानीय मॉडल प्रबंधन और अनुमान इंजन मुफ़्त मुफ़्त llama.cpp सीधे संकलित करें और चलाएँ
ग्राफ़िकल स्थानीय अनुमान क्लाइंट मुफ़्त मुफ़्त ओलामा + वेबयूआई खोलें
लामा.सीपीपी अंतर्निहित उच्च-प्रदर्शन अनुमान इंजन खुला स्रोत मुफ़्त एमएलएक्स (एप्पल सिलिकॉन)
<exlink type='tool' slug='qwen' name='Qwen''> क्लाइंट-साइड छोटा मॉडल (1.5B-72B) मुफ़्त/खुला स्रोत मुफ़्त <exlink type='tool' slug='डीपसीक' नाम='डीपसीक'>
एप्पल इंटेलिजेंस Apple ऑन-डिवाइस AI फ्रेमवर्क अंतर्निर्मित प्रणाली मुफ़्त (M1+/A17+ की आवश्यकता है) क्वालकॉम एआई इंजन
क्लाउड तुलना/सहायक एनोटेशन मुफ़्त संस्करण/प्लस संस्करण $20/माह एपीआई उपयोग द्वारा <एक्सलिंक प्रकार = "टूल" स्लग = "क्लाउड" नाम = "क्लाउड">
<एक्सलिंक प्रकार='टूल' स्लग='डीपसीक' नाम='डीपसीक'> ओपन सोर्स लाइटवेट मॉडल (R1/V3) मुफ़्त/खुला स्रोत मुफ़्त डिवाइस साइड

तैयारी

कार्यान्वयन शुरू करने से पहले, कृपया निम्नलिखित तैयारियों की एक-एक करके पुष्टि करें:

  • [ ] पुष्टि करें कि टर्मिनल डिवाइस एनपीयू या जीपीयू हार्डवेयर त्वरण (एप्पल न्यूरल इंजन / क्वालकॉम हेक्सागोन / इंटेल एनपीयू) का समर्थन करता है
  • [ ] नवीनतम डिवाइस ड्राइवर और एनपीयू एसडीके स्थापित करें (जैसे ऐप्पल कोरएमएल, क्वालकॉम एआई इंजन डायरेक्ट)
  • [ ] मॉडल फ़ाइल भंडारण के लिए 10-20 जीबी खाली डिस्क स्थान तैयार करें
  • [ ] होमब्रू (मैकओएस) या पैकेज मैनेजर (लिनक्स/विंडोज) स्थापित करें
  • [ ] पुष्टि करें कि नेटवर्क वातावरण हगिंग फेस/ओलामा मॉडल वेयरहाउस डाउनलोड कर सकता है
  • [ ] पायथन 3.10+ विकास परिवेश की पुष्टि करें
  • [ ] सुरक्षा टीम के साथ निजी डेटा प्रोसेसिंग के दायरे के लिए अनुपालन आवश्यकताओं की पुष्टि करें

चरण-दर-चरण मार्गदर्शिका

चरण 1: उपकरण मूल्यांकन और मॉडल चयन

⏱अनुमानित समय: 1-2 दिन 🎯लक्ष्य: लक्ष्य डिवाइस की कंप्यूटिंग शक्ति, मेमोरी और व्यावसायिक परिदृश्यों के आधार पर सबसे उपयुक्त डिवाइस-साइड मॉडल विनिर्देश और परिमाणीकरण स्तर निर्धारित करें। ⚠️ पूर्वावश्यकता: डिवाइस हार्डवेयर सूची की पुष्टि कर दी गई है

ऑपरेशन निर्देश

एंड-साइड मॉडल चयन संपूर्ण लिंक का आधार है। विभिन्न उपकरणों की एनपीयू कंप्यूटिंग शक्ति, मेमोरी बैंडविड्थ और वीडियो मेमोरी क्षमता, चलाए जा सकने वाले मॉडल मापदंडों की अधिकतम संख्या निर्धारित करती है। उदाहरण के लिए, 8 जीबी मेमोरी वाला एक एआई पीसी 7बी से नीचे क्वांटाइजेशन मॉडल के लिए उपयुक्त है, और 16 जीबी 13बी क्वांटाइजेशन मॉडल चला सकता है, जबकि एक एआई फोन आमतौर पर केवल 1.5बी-7बी का पैरामीटर स्केल ले सकता है।

विशिष्ट संचालन

  1. डिवाइस की टोकन/एस अनुमान गति को रिकॉर्ड करने के लिए डिवाइस बेंचमार्क टूल (जैसे कि ओलामा का अंतर्निहित ओलामा रन --बेंचमार्क) चलाएं
  2. उपलब्ध मेमोरी के आधार पर मॉडल विनिर्देशों का चयन करें (नीचे दी गई तालिका देखें), चलाए जा सकने वाले सबसे बड़े मॉडल को प्राथमिकता दें।
  3. परिमाणीकरण स्तर निर्धारित करें: Q4_K_M सटीकता और प्रदर्शन के बीच सबसे अच्छा संतुलन है; Q2_K अत्यधिक संसाधन-विवश परिदृश्यों के लिए उपयुक्त है; Q8_0 सटीकता-प्रथम परिदृश्यों के लिए उपयुक्त है
  4. AI फोन के लिए, 1.5B-3B एंड-साइड समर्पित छोटे मॉडल (जैसे Qwen2.5-1.5B-Instruct, DeepSeek-R1-Distill-Qwen-1.5B) को प्राथमिकता दें।
  5. चयन निर्णय मैट्रिक्स रिकॉर्ड करें: मॉडल का नाम, परिमाणीकरण स्तर, अनुमानित मेमोरी उपयोग, लक्ष्य टोकन/एस

चयन संदर्भ मैट्रिक्स

डिवाइस का प्रकार अनुशंसित मॉडल आकार अनुशंसित मात्रा निर्धारण विशिष्ट मॉडल अनुमानित अनुमान गति
एआई पीसी (32जीबी+) 13बी-72बी Q4_K_M / Q5_K_M क्वेन2.5-14बी, डीपसीक-आर1-डिस्टिल-क्यूवेन-14बी 15-40 टोकन/सेक
एआई पीसी (16जीबी) 7बी-13बी Q4_K_M क्वेन2.5-7बी, लामा-3.1-8बी 25-50 टोकन/सेक
एआई पीसी (8जीबी) 1.5बी-7बी Q4_K_M / Q3_K_M Qwen2.5-7B-Q4, Phi-3-मिनी 30-60 टोकन/सेक
एआई फोन (12जीबी+) 3बी-7बी Q4_K_M / Q3_K_S क्वेन2.5-3बी, डीपसीक-आर1-डिस्टिल-क्यूवेन-1.5बी 10-30 टोकन/सेक
एआई फोन (8जीबी) 1.5बी-3बी Q4_K_M क्वेन2.5-1.5बी, जेम्मा-2-2बी 15-35 टोकन/सेक

सत्यापन विधि

  • ✅ चयन मैट्रिक्स दस्तावेज़ टीम समीक्षा में उत्तीर्ण हुआ
  • ✅ लक्ष्य मॉडल ≥10 टोकन/सेकेंड पर लक्ष्य डिवाइस पर स्थिर रूप से चल सकता है
  • ✅ मॉडल लोड होने के बाद, डिवाइस की मुफ्त मेमोरी ≥ 2GB है (सिस्टम फ़्रीज़ से बचने के लिए)

चरण 2: स्थानीय अनुमान वातावरण स्थापित करें

⏱अनुमानित समय: 1-2 दिन 🎯 लक्ष्य: लक्ष्य डिवाइस पर ओलामा / एलएम स्टूडियो अनुमान वातावरण की स्थापना, मॉडल डाउनलोड और बुनियादी संचालन सत्यापन पूरा करें ⚠️ पूर्वापेक्षाएँ: मॉडल चयन मैट्रिक्स की पुष्टि हो गई है और बुनियादी उपकरण वातावरण तैयार है

ऑपरेशन निर्देश

ओलामा वर्तमान में सबसे परिपक्व डिवाइस-साइड इंट्रेंस फ्रेमवर्क है, जो macOS/Linux/Windows को सपोर्ट करता है। इसमें एक अंतर्निर्मित मॉडल वेयरहाउस और एक OpenAI संगत एपीआई है। आप एक कमांड से मॉडल को डाउनलोड और चला सकते हैं। एलएम स्टूडियो एक जीयूआई इंटरफ़ेस प्रदान करता है, जो गैर-कमांड लाइन उपयोगकर्ताओं और मॉडल प्रदर्शन तुलना के लिए उपयुक्त है। llama.cpp वह अंतर्निहित इंजन है जिस पर ओलामा और LM स्टूडियो बने हैं। यदि आपको अनुमान मापदंडों को गहराई से अनुकूलित करने की आवश्यकता है, तो आप सीधे llama.cpp का उपयोग कर सकते हैं।

विशिष्ट संचालन

  1. ओलामा इंस्टॉल करें (मैकओएस/लिनक्स/विंडोज):
    #मैकओएस
    ब्रू इंस्टॉल ओलामा
    #लिनक्स
    कर्ल -fsSL https://ollama.com/install.sh | श
    #Windows इंस्टालेशन पैकेज ollama.com से डाउनलोड करें
  2. चयनित मॉडल डाउनलोड करें और चलाएं:
    # पुल मॉडल (उदाहरण के तौर पर Qwen2.5-7B लें)
    ओलामा पुल क्वेन2.5:7बी
    # इंटरैक्टिव बातचीत शुरू करें
    ओलामा रन क्वेन2.5:7बी
  3. ओपनएआई संगत एपीआई सत्यापित करें:
    कर्ल http://localhost:11434/v1/chat/completions \
     -एच "सामग्री-प्रकार: एप्लिकेशन/जेसन" \
     -d '{"मॉडल": "qwen2.5:7b", "संदेश": [{"भूमिका": "उपयोगकर्ता", "सामग्री": "हैलो"}]}'
  4. एलएम स्टूडियो स्थापित करें (वैकल्पिक जीयूआई विकल्प):
    • lmstudio.ai से डाउनलोड और इंस्टॉल करें
    • इंटरफ़ेस के माध्यम से मॉडल खोजें और डाउनलोड करें
    • स्थानीय HTTP सेवा प्रारंभ करें (सेटिंग्स > स्थानीय HTTP सर्वर)
  5. मल्टी-मॉडल प्रबंधन कॉन्फ़िगर करें: विभिन्न कार्यों के लिए अलग-अलग मॉडल कॉन्फ़िगर करें, जैसे सरल बातचीत के लिए हल्के मॉडल और जटिल तर्क के लिए बड़े मॉडल।

कुंजी अभिगम नियंत्रण

  • ✅ डिवाइस चालू होने के बाद ओलामा सेवा स्वचालित रूप से प्रारंभ हो जाती है ('ओलामा सर्व' सिस्टम सेवा के रूप में पंजीकृत है)
  • ✅ एपीआई प्रतिक्रिया समय <500 एमएस (पहले लोड के बाद)
  • ✅ एलएम स्टूडियो जीयूआई सामान्य रूप से कम से कम 3 अलग-अलग मॉडलों को लोड और चला सकता है
  • ✅ पुष्टि करें कि मॉडल फ़ाइलें अपेक्षित पथ में संग्रहीत हैं (डिफ़ॉल्ट ~/.ollama/models/)

चरण 3: एनपीयू/जीपीयू त्वरण कॉन्फ़िगरेशन

⏱अनुमानित समय: 1-3 दिन 🎯लक्ष्य: प्रयोग करने योग्य स्तर तक अनुमान दक्षता बढ़ाने के लिए डिवाइस एनपीयू या जीपीयू की हार्डवेयर त्वरण क्षमताओं को सक्षम करें ⚠️पूर्व शर्त: मूल अनुमान वातावरण सामान्य रूप से चल रहा है

ऑपरेशन निर्देश

एंड-साइड अनुमान की प्रदर्शन बाधाएँ आमतौर पर मेमोरी बैंडविड्थ और कंप्यूटिंग इकाइयाँ हैं। ऐप्पल सिलिकॉन की एकीकृत मेमोरी आर्किटेक्चर सीपीयू/जीपीयू/एनपीयू को सीपीयू-जीपीयू डेटा कॉपी किए बिना मेमोरी पूल साझा करने की अनुमति देती है, जो स्वाभाविक रूप से बड़े मॉडल तर्क के लिए उपयुक्त है। क्वालकॉम स्नैपड्रैगन एक्स एलीट का हेक्सागोन एनपीयू और इंटेल कोर अल्ट्रा का एकीकृत एनपीयू भी समर्पित एआई त्वरण इकाइयां प्रदान करता है। विभिन्न प्लेटफार्मों में अलग-अलग त्वरण समाधान होते हैं और लक्षित कॉन्फ़िगरेशन की आवश्यकता होती है।

विशिष्ट संचालन

  1. एप्पल सिलिकॉन (मेटल जीपीयू एक्सेलेरेशन):

    # ओलामा स्वचालित रूप से धातु का पता लगाता है, किसी अतिरिक्त कॉन्फ़िगरेशन की आवश्यकता नहीं है
    # पुष्टि करें कि मेटल सक्षम है
    ओलामा रन--वर्बोज़ क्वेन2.5:7बी
    # यह पुष्टि करने के लिए कि धातु का उपयोग किया गया है, आउटपुट में "llama_print_timings" जांचें
    
    # यदि आपको MLX फ्रेमवर्क (Apple आधिकारिक अनुकूलन) का उपयोग करने की आवश्यकता है
    पिप इंस्टॉल एमएलएक्स-एलएम
    पायथन -m mlx_lm.generate --मॉडल Qwen/Qwen2.5-7B-Instruct-MLX
  2. क्वालकॉम स्नैपड्रैगन एक्स एलीट/एआई फोन (क्वालकॉम एआई इंजन):
    # क्वालकॉम एआई हब का उपयोग करके अनुकूलन मॉडल तैनात करें
    पिप इंस्टॉल क्यूई-हब
    #SNPE या QNN SDK इंस्टॉल करें
    # मॉडल परिमाणीकरण और परिनियोजन के लिए क्वालकॉम आधिकारिक दस्तावेज़ देखें
  3. इंटेल कोर अल्ट्रा (ओपनविनो/इंटेल एनपीयू):
    # OpenVINO बैकएंड का उपयोग करके ओलामा चलाएँ
    OLLAMA_INTEL_OPENVINO=1 ओलामा सर्व
    # या इंटेल एनपीयू एक्सेलेरेशन लाइब्रेरी का उपयोग करें
    पिप इंटेल-एनपीयू-एक्सेलेरेशन-लाइब्रेरी स्थापित करें
  4. सत्यापित करें कि त्वरण प्रभावी होता है: केवल सीपीयू और एनपीयू/जीपीयू मोड की अनुमान गति की तुलना करें, अंतर 2-5 गुना होना चाहिए

त्वरण प्रभाव संदर्भ

उपकरण त्वरण समाधान 7बी मॉडल अनुमान गति (केवल सीपीयू) त्वरण के बाद गति सुधार एकाधिक
मैकबुक प्रो एम3 ​​मैक्स मेटल जीपीयू 15 टोकन/सेक 45 टोकन/सेक 3x
मैकबुक एयर एम2 मेटल जीपीयू 10 टोकन/सेक 28 टोकन/सेक 2.8x
स्नैपड्रैगन एक्स एलीट हेक्सागोन एनपीयू 8 टोकन/सेक 22 टोकन/सेक 2.75x
इंटेल कोर अल्ट्रा 7 ओपनविनो एनपीयू 6 टोकन/सेक 15 टोकन/सेक 2.5x
स्नैपड्रैगन 8 जेन 3 फ़ोन क्वालकॉम एआई इंजन 4 टोकन/एस 12 टोकन/एस 3x

सत्यापन विधि

  • ✅ अनुमान की गति लक्ष्य सीमा तक पहुंचती है (चैट परिदृश्य ≥ 20 टोकन/सेकेंड, कोड परिदृश्य ≥ 15 टोकन/सेकेंड)
  • ✅ 30 मिनट तक लगातार डिवाइस तापमान का अनुमान लगाने से थ्रॉटलिंग ट्रिगर नहीं होती (<85°C)
  • ✅ बैटरी जीवन पर स्वीकार्य प्रभाव (एआई फोन निरंतर अनुमान 30 मिनट के लिए 15% से कम बिजली की खपत करता है)

चरण 4: एंड-साइड अनुप्रयोगों का एकीकृत विकास

⏱अनुमानित समय: 3-7 दिन 🎯लक्ष्य: एंड-साइड एआई उत्पादों के पूर्ण कार्यात्मक बंद लूप को प्राप्त करने के लिए लक्ष्य व्यावसायिक अनुप्रयोगों में स्थानीय तर्क क्षमताओं को एकीकृत करें ⚠️पूर्व शर्ते: अनुमान वातावरण स्थिर है और त्वरण विन्यास प्रभावी होता है

ऑपरेशन निर्देश

ऑन-डिवाइस AI का अंतिम मूल्य विशिष्ट अनुप्रयोगों में परिलक्षित होता है। एकीकरण विधि लक्ष्य परिदृश्य पर निर्भर करती है: डेस्कटॉप एप्लिकेशन HTTP एपीआई के माध्यम से ओलामा स्थानीय सेवाओं को कॉल करते हैं, और मोबाइल टर्मिनल टेन्सरफ्लो लाइट / कोरएमएल / ओएनएनएक्स रनटाइम जैसे ढांचे के माध्यम से मात्रात्मक मॉडल लोड करते हैं। कुंजी "मुख्य भाग के रूप में क्लाइंट-साइड और पूरक के रूप में क्लाउड" की एक हाइब्रिड अनुमान रणनीति तैयार करना है - सरल/निजी कार्य डिवाइस-साइड पर जाते हैं और जटिल कार्य क्लाउड पर वापस आते हैं।

विशिष्ट संचालन

  1. डेस्कटॉप एप्लिकेशन एकीकरण (पायथन/टाइपस्क्रिप्ट):

    # पायथन उदाहरण: ओलामा एपीआई के माध्यम से स्थानीय चैट
    आयात अनुरोध
    
    def local_chat(संकेत: str) -> str:
       प्रतिक्रिया = अनुरोध.पोस्ट(
           "http://localhost:11434/v1/chat/completions",
           json={
               "मॉडल": "qwen2.5:7b",
               "संदेश": [{"भूमिका": "उपयोगकर्ता", "सामग्री": शीघ्र}],
               "स्ट्रीम": गलत
           }
       )
       वापसी प्रतिक्रिया.जेसन()["विकल्प"][0]["संदेश"]["सामग्री"]
  2. एआई फोन एकीकरण (एंड्रॉइड/आईओएस):
    • एंड्रॉइड: क्वालकॉम एआई इंजन डायरेक्ट या मीडियाटेक न्यूरोपायलट एसडीके का उपयोग करके टीएफलाइट मॉडल लोड करें
    • iOS: मॉडल को .mlpackage फॉर्मेट में बदलने और इसे Apple न्यूरल इंजन के माध्यम से चलाने के लिए CoreML का उपयोग करें
    • क्रॉस-प्लेटफ़ॉर्म समाधान: एमएनएन या एनसीएनएन जैसे हल्के अनुमान इंजन का उपयोग करें
  3. हाइब्रिड तर्क रणनीति कार्यान्वयन:
    डीईएफ़ हाइब्रिड_इंफ़रेंस (संकेत: str, गोपनीयता_स्तर: str = "स्थानीय"):
       यदि गोपनीयता_स्तर == "स्थानीय" या is_sensitive_data(संकेत):
           स्थानीय_चैट लौटाएं(प्रॉम्प्ट) #डिवाइस-साइड तर्क
       अन्य:
           रिटर्न क्लाउड_चैट (प्रॉम्प्ट) # क्लाउड एपीआई (जैसे चैटजीपीटी/क्लाउड)
  4. एंड-साइड आरएजी पाइपलाइन बनाएं (गोपनीयता परिदृश्य):
    • स्थानीय वेक्टर डेटाबेस (क्रोमा/लांसडीबी) + स्थानीय एंबेडिंग मॉडल
    • सभी दस्तावेज़ अनुक्रमण डिवाइस के भीतर पूरा हो जाता है, और डेटा डिवाइस नहीं छोड़ता है
  5. स्ट्रीमिंग आउटपुट लागू करें: चैटजीपीटी जैसा टाइपिंग प्रभाव प्राप्त करने के लिए एसएसई (सर्वर-भेजे गए इवेंट) का उपयोग करें

गोपनीयता डेटा प्रोसेसिंग नीति

डेटा प्रकार प्रसंस्करण विधि अनुशंसित मॉडल विवरण
मेडिकल रिकॉर्ड केवल डिवाइस-साइड Qwen2.5-7B-Q4 डेटा डिवाइस को नहीं छोड़ता है, और केवल सारांश को अनुमान लॉग में रखा जाता है
वित्तीय लेनदेन केवल ग्राहक पक्ष डीपसीक-आर1-डिस्टिल-क्वेन-7बी क्लाउड फ़ॉलबैक को अस्वीकार करें
कोड स्निपेट्स क्लाइंट-साइड प्राथमिकता Qwen2.5-कोडर-7बी क्लाउड पर वापस आ सकते हैं (अनामीकरण के बाद)
दैनिक वार्तालाप क्लाइंट-साइड प्राथमिकता कोई भी 3B-7B मॉडल फ़ॉलबैक उपलब्ध
दस्तावेज़ सारांश क्लाइंट-साइड प्रोसेसिंग Qwen2.5-7B-Q4 पूर्ण पाठ प्रसंस्करण, केवल आउटपुट सारांश

सत्यापन विधि

  • ✅ एंड-टू-एंड अनुमान लिंक एंड-टू-एंड उपलब्ध है, उपयोगकर्ता इनपुट से लेकर एआई प्रतिक्रिया तक ≤ 3 सेकंड
  • ✅ हाइब्रिड रूटिंग रणनीति सही है: निजी डेटा कभी भी क्लाउड फ़ॉलबैक को ट्रिगर नहीं करेगा
  • ✅ स्ट्रीमिंग आउटपुट अनुभव स्पष्ट रुकावटों के बिना सहज है।
  • ✅ ऐप डिवाइस के बैकग्राउंड में बिना क्रैश हुए 4 घंटे तक चलता है

चरण 5: गोपनीयता सुरक्षा और प्रदर्शन परीक्षण

⏱अनुमानित समय: 2-3 दिन 🎯लक्ष्य: सत्यापित करें कि डेटा डिवाइस को नहीं छोड़ता है, और एंड-साइड एआई के समग्र प्रदर्शन, बिजली की खपत और स्थिरता का मूल्यांकन करें ⚠️ पूर्वापेक्षाएँ: एप्लिकेशन एकीकरण विकास पूरा हो गया है और कार्यात्मक तर्क प्रारंभिक समीक्षा से गुजरता है

ऑपरेशन निर्देश

ऑन-डिवाइस AI के मूल मूल्यों में से एक गोपनीयता सुरक्षा है। हालाँकि, "डेटा डिवाइस को नहीं छोड़ता" के लिए एक सत्यापन योग्य साक्ष्य श्रृंखला की आवश्यकता होती है और केवल विश्वास कथनों पर भरोसा नहीं किया जा सकता है। साथ ही, बिजली की खपत, गर्मी अपव्यय और एंड-साइड अनुमान की स्थिरता सीधे उपयोगकर्ता अनुभव को प्रभावित करती है, और मात्रात्मक संकेतक स्थापित किए जाने चाहिए।

विशिष्ट संचालन

  1. गोपनीयता ऑडिट:
    • यह सत्यापित करने के लिए कि कोई डेटा बाहर नहीं भेजा गया है, नेटवर्क पैकेट कैप्चर टूल (वायरशार्क/चार्ल्स) का उपयोग करें
    • यह सुनिश्चित करने के लिए ऐप अनुमति सूची की जांच करें कि कोई अनावश्यक नेटवर्क अनुमतियों का उपयोग नहीं किया गया है
    • यह पुष्टि करने के लिए सिस्टम फ़ायरवॉल का उपयोग करें कि अनुमान प्रक्रिया केवल लोकलहोस्ट पर ही सुनी जा रही है
  2. प्रदर्शन बेंचमार्क टेस्ट:

    आयात समय
    
    def बेंचमार्क_इंफरेंस (मॉडल: str, प्रॉम्प्ट: str, पुनरावृत्तियों: int = 10):
       समय = []
       रेंज (पुनरावृत्तियों) में _ के लिए:
           प्रारंभ = समय.समय()
           # स्थानीय अनुमान एपीआई को कॉल करें
           परिणाम = स्थानीय_चैट (प्रॉम्प्ट)
           बीता हुआ = समय.समय()-प्रारंभ
           समय.जोड़ें(बीता हुआ)
       वापसी {
           "औसत": योग(समय) / लेन(समय),
           "मिनट": मिनट(समय),
           "अधिकतम": अधिकतम(बार),
           "पी95": क्रमबद्ध(समय)[इंट(लेन(समय) * 0.95)]
       }
  3. बिजली खपत परीक्षण (एआई फोन):
    • अनुमान बिजली की खपत को रिकॉर्ड करने के लिए एंड्रॉइड बैटरी हिस्टोरियन / आईओएस एनर्जी लॉग का उपयोग करें
    • डिवाइस साइड बनाम क्लाउड पर समान कार्य की ऊर्जा खपत की तुलना करें
  4. स्थिरता परीक्षण: निरंतर अनुमान के 100 राउंड, निगरानी कि क्या ओओएम, टोकन गिरावट या अनुमान अटक गया है

स्वीकृति मानदंड

  • [ ] नेटवर्क पैकेट कैप्चर शून्य डेटा आउटगोइंग की पुष्टि करता है (क्लाउड फ़ॉलबैक परिदृश्य को छोड़कर)
  • [ ] पहला टोकन विलंब ≤ 500 एमएस (अंत पक्ष)
  • [ ] एप्लिकेशन नो-लोड मेमोरी उपयोग ≤ 500 एमबी, अनुमान के दौरान ≤ 2 जीबी (एआई पीसी) / ≤ 1 जीबी (एआई फोन)
  • [ ] डिवाइस के तापमान का 30 मिनट तक लगातार अनुमान थर्मल थ्रॉटलिंग थ्रेशोल्ड को ट्रिगर नहीं करता है
  • [ ] गोपनीयता डेटा प्रोसेसिंग प्रक्रिया का सुरक्षा टीम द्वारा ऑडिट किया गया है

अपेक्षित परिणाम

संकेतक बादल समाधान डिवाइस-साइड समाधान (यह समाधान)
अनुमान में देरी (पहला टोकन) 500-2000 एमएस (नेटवर्क सहित) 100-500ms
डेटा गोपनीयता क्लाउड सेवा प्रदाता की प्रतिबद्धता पर भरोसा करें डेटा डिवाइस को नहीं छोड़ता, ऑडिट और सत्यापित किया जा सकता है
ऑफ़लाइन उपलब्धता उपलब्ध नहीं है पूरी तरह ऑफ़लाइन चलता है
एकल अनुमान लागत $0.001-0.01 शून्य के करीब (केवल बिजली लागत)
मॉडल सटीकता उच्च (पूर्ण बादल सटीकता) मध्यम-उच्च (मात्रा निर्धारण के बाद 95-98%)
परिनियोजन विधि क्लाउड होस्टिंग डिवाइस को स्थानीय स्तर पर स्थापित और उपयोग किया जा सकता है

स्वीकृति मानदंड

  • [ ] क्लाइंट-साइड अनुमान विलंब ≤ 500 एमएस, वास्तविक समय इंटरैक्शन आवश्यकताओं को पूरा करना
  • [ ] गोपनीयता ऑडिट रिपोर्ट सुरक्षा टीम द्वारा समीक्षा में पारित हो गई
  • [ ] डिवाइस-साइड एआई फ़ंक्शन पूरी तरह से गैर-नेटवर्क वातावरण में चल सकता है
  • [ ] ऐप बिना किसी क्रैश या मेमोरी लीक के लगातार 4 घंटे तक चलता है
  • [ ] हाइब्रिड अनुमान रणनीति सभी निजी डेटा को सही ढंग से रूट करती है

अक्सर पूछे जाने वाले प्रश्न और समस्या निवारण

प्रश्न: मेरे डिवाइस में केवल 8जीबी मेमोरी है। यह कितना बड़ा मॉडल चला सकता है? उत्तर: 8GB उपकरणों के लिए 1.5B-7B के Q4_K_M परिमाणीकरण मॉडल का उपयोग करने की अनुशंसा की जाती है। 7बी मॉडल चलाते समय, लगभग 2-3 जीबी मुफ्त मेमोरी बची होती है, जो सिस्टम ऑपरेशन को पूरा कर सकती है। यदि आप OOM का सामना करते हैं, तो Q3_K_M परिमाणीकरण पर स्विच करें या 3B से नीचे का मॉडल चुनें।

प्रश्न: क्या क्लाइंट-साइड मॉडल और क्लाउड मॉडल की सटीकता के बीच कोई बड़ा अंतर है? उत्तर: Q4_K_M परिमाणीकरण आमतौर पर मूल मॉडल की 95-98% क्षमताओं को बरकरार रख सकता है, और सामान्य संवाद, दस्तावेज़ सारांश और कोड पूर्णता जैसे परिदृश्यों में अंतर स्पष्ट नहीं है। हालाँकि, जटिल गणितीय तर्क और लंबे पाठों की सटीक समझ जैसे परिदृश्यों में, अंत-पक्ष परिमाणीकरण मॉडल को 5-10% सटीकता का नुकसान हो सकता है। प्रमुख व्यावसायिक नोड्स पर मैन्युअल समीक्षा लिंक जोड़ने की अनुशंसा की जाती है।

प्रश्न: यदि एनपीयू त्वरण के बाद प्रभाव स्पष्ट नहीं होता है तो मुझे क्या करना चाहिए? उ: सबसे पहले पुष्टि करें कि एनपीयू ड्राइवर सही ढंग से स्थापित किया गया है और अनुमान ढांचे ने वास्तव में एनपीयू बैकएंड को कॉल किया है (लॉग में बैकएंड जानकारी की जांच करें)। कुछ एनपीयू का बैच आकार=1 परिदृश्य में त्वरण प्रभाव सीमित होता है, क्योंकि एनपीयू के समानांतर कंप्यूटिंग लाभों को साकार करने के लिए एक निश्चित मात्रा में गणना की आवश्यकता होती है। इस समय, आप GPU बैकएंड आज़मा सकते हैं। आम तौर पर, GPU छोटे बैच परिदृश्यों में बेहतर प्रदर्शन करता है।

प्रश्न: क्लाइंट-साइड मॉडल की गोपनीयता सुरक्षा को कैसे सत्यापित करें? उत्तर: यह समाधान ट्रिपल सत्यापन प्रदान करता है: ① नेटवर्क पैकेट कैप्चर पुष्टि करता है कि कोई डेटा बाहर नहीं भेजा गया है; ② सिस्टम फ़ायरवॉल पुष्टि करता है कि अनुमान प्रक्रिया केवल लोकलहोस्ट को सुनती है; ③ कोड ऑडिट पुष्टि करता है कि हाइब्रिड रूटिंग रणनीति निजी डेटा को सही ढंग से इंटरसेप्ट करती है। प्रवेश परीक्षण करने के लिए तीसरे पक्ष की सुरक्षा टीम को आमंत्रित करने की अनुशंसा की जाती है।

प्रश्न: क्लाइंट-साइड समाधान और क्लाउड समाधान के बीच चयन कैसे करें? उत्तर: क्लाइंट-साइड समाधान निम्नलिखित परिदृश्यों को प्राथमिकता देता है: ① उच्च डेटा गोपनीयता आवश्यकताएँ (चिकित्सा, वित्तीय, कानूनी); ② ऑफ़लाइन उपलब्ध होने की आवश्यकता है (यात्रा, सैन्य उद्योग, दूरस्थ क्षेत्र); ③ विलंब-संवेदनशील परिदृश्य (वास्तविक समय अनुवाद, आवाज सहायक)। क्लाउड समाधान इसके लिए उपयुक्त है: ① बड़े मॉडलों के उच्च-सटीक तर्क की आवश्यकता है; ② वास्तविक समय ज्ञान अद्यतन आवश्यक है; ③ मॉडल मापदंडों की संख्या उपकरण ले जाने की सीमा से अधिक है। दोनों को एक संकर समाधान में जोड़ा जा सकता है।

अवधि और परिणाम

स्टेज अनुमानित समय आउटपुट
उपकरण मूल्यांकन और मॉडल चयन 1-2 दिन चयन मैट्रिक्स दस्तावेज़
स्थानीय अनुमान पर्यावरण सेटअप 1-2 दिन चलाने योग्य अनुमान सेवा
एनपीयू/जीपीयू त्वरण विन्यास 1-3 दिन त्वरण प्रदर्शन रिपोर्ट
डिवाइस-साइड एप्लिकेशन एकीकृत विकास 3-7 दिन एआई क्षमताओं को एकीकृत करने वाला एप्लिकेशन प्रोटोटाइप
गोपनीयता सुरक्षा और प्रदर्शन परीक्षण 2-3 दिन परीक्षण रिपोर्ट और लेखापरीक्षा प्रमाणीकरण
कुल 8-17 दिन डिवाइस पर डिलीवर करने योग्य एआई एप्लिकेशन

फायदे और नुकसान

लाभ

  • गोपनीयता सुरक्षा: डेटा डिवाइस को नहीं छोड़ता, क्लाउड लीक के जोखिम से बचता है और जीडीपीआर/"व्यक्तिगत सूचना संरक्षण अधिनियम" अनुपालन आवश्यकताओं को पूरा करता है।
  • कम विलंबता: नेटवर्क ट्रांसमिशन ओवरहेड को हटा दें, तर्क विलंब <500 एमएस, वास्तविक समय इंटरैक्शन परिदृश्यों के लिए उपयुक्त
  • ऑफ़लाइन उपलब्ध: नेटवर्क निर्भरता से पूरी तरह स्वतंत्र, यात्रा, दूरदराज के क्षेत्रों और सैन्य परिदृश्यों के लिए उपयुक्त
  • नियंत्रणीय लागत: कोई चालू एपीआई कॉल शुल्क नहीं, हार्डवेयर में एक बार के निवेश के बाद सीमांत लागत शून्य के करीब पहुंच जाती है
  • निजीकरण: गोपनीयता को उजागर किए बिना व्यक्तिगत अनुभव प्राप्त करने के लिए मॉडल को ठीक किया जा सकता है और स्थानीय स्तर पर लगातार सीखा जा सकता है

नुकसान

  • मॉडल सटीकता सीमित है: उपकरण कंप्यूटिंग शक्ति की सीमा के कारण, डिवाइस-साइड मॉडल के मापदंडों की संख्या बड़े क्लाउड मॉडल की तुलना में बहुत कम है, और जटिल अनुमान परिदृश्यों की सटीकता क्लाउड जितनी अच्छी नहीं है।
  • डिवाइस विखंडन: विभिन्न निर्माताओं के एनपीयू आर्किटेक्चर और एसडीके असंगत हैं, और क्रॉस-प्लेटफॉर्म अनुकूलन लागत अधिक है
  • मॉडल अपडेट लैग: क्लाइंट-साइड मॉडल अपडेट के लिए पुनः डाउनलोड करने या ओटीए पुश की आवश्यकता होती है, और पुनरावृत्ति चक्र क्लाउड एपीआई की तुलना में लंबा है
  • हार्डवेयर थ्रेशोल्ड: अच्छे अनुभव के लिए एनपीयू या स्वतंत्र जीपीयू समर्थन की आवश्यकता होती है, और निम्न-स्तरीय उपकरणों का अनुभव खराब होता है

टूल सारांश

उपकरण का नाम प्रकार इस परिदृश्य में भूमिका
<एक्सलिंक प्रकार='टूल' स्लग='ओलामा' नाम='ओलामा'> अनुमान रूपरेखा स्थानीय मॉडल प्रबंधन और अनुमान इंजन (कोर)
अनुमान रूपरेखा ग्राफ़िकल क्लाइंट, मॉडल तुलना परीक्षण
लामा.सीपीपी अनुमान इंजन निम्न-स्तरीय उच्च-प्रदर्शन अनुमान, ओलामा/एलएम स्टूडियो की आधारशिला
<exlink type='tool' slug='qwen' name='Qwen''> एंड-टू-एंड मॉडल अनुशंसित मुख्य एंड-टू-एंड मॉडल श्रृंखला
<exlink type='टूल' स्लग='डौबाओ' नाम='डौबाओ (डौबाओ)'> एंड-टू-साइड मॉडल घरेलू एंड-टू-साइड मॉडल विकल्प
एप्पल इंटेलिजेंस सिस्टम फ्रेमवर्क Apple डिवाइस साइड AI क्षमता प्लेटफार्म
<एक्सलिंक प्रकार='टूल' स्लग='डीपसीक' नाम='डीपसीक'> डिवाइस-साइड मॉडल ओपन सोर्स अनुमान मॉडल का डिवाइस-साइड परिनियोजन समाधान
बादल तुलना क्लाउड फ़ॉलबैक और तुलना परीक्षण
<एक्सलिंक प्रकार = "टूल" स्लग = "क्लाउड" नाम = "क्लाउड"> बादल तुलना सुरक्षा-संवेदनशील परिदृश्यों के लिए क्लाउड विकल्प

उन्नति और विस्तार

यह समाधान एक स्तरित वास्तुकला डिज़ाइन को अपनाता है और इसे व्यवसाय विकास के अनुसार धीरे-धीरे विस्तारित किया जा सकता है:

  1. डिवाइस-साइड RAG नॉलेज बेस: पूरी तरह से ऑफ़लाइन ज्ञान प्रश्न और उत्तर प्रणाली बनाने के लिए स्थानीय वेक्टर डेटाबेस (Chroma/LanceDB) + स्थानीय एंबेडिंग मॉडल तैनात करें। सभी दस्तावेज़ अनुक्रमण और पुनर्प्राप्ति डिवाइस के भीतर पूरे हो गए हैं
  2. डिवाइस-साइड एजेंट सिस्टम: स्थानीय मॉडल की फ़ंक्शन कॉलिंग क्षमता का उपयोग करें और एक निजी और सुरक्षित व्यक्तिगत एआई सहायक बनाने के लिए स्थानीय टूल (कैलेंडर, फ़ाइलें, ईमेल) को कॉल करने के लिए इसे एमसीपी प्रोटोकॉल के साथ संयोजित करें।
  3. मल्टी-डिवाइस सहयोगात्मक तर्क: घर/कार्यालय लैन में, क्रॉस-डिवाइस मॉडल लोडिंग वितरित तर्क के माध्यम से प्राप्त की जाती है (जैसे कि मोबाइल फोन हल्के अनुरोधों को संसाधित करते हैं और पीसी जटिल अनुरोधों को संसाधित करते हैं)
  4. डिवाइस-साइड फ़ाइन-ट्यूनिंग और वैयक्तिकरण: उपयोगकर्ता डेटा को उजागर किए बिना वैयक्तिकृत अनुभव प्राप्त करने के लिए डिवाइस पर बुनियादी मॉडल को क्रमिक रूप से प्रशिक्षित करने के लिए QLoRA/Lora जैसी तकनीकों का उपयोग करें
  5. मात्रात्मक आसवन पाइपलाइन: क्लाउड बड़े मॉडल से अंत-साइड छोटे मॉडल तक एक आसवन पाइपलाइन बनाएं, और विशिष्ट व्यावसायिक परिदृश्यों के लिए हल्के समर्पित मॉडल को अनुकूलित करें।
  6. डिवाइस-साइड मल्टी-मोडल: संपूर्ण एंड-साइड मल्टी-मोडल क्षमताओं को प्राप्त करने के लिए स्थानीय छवि समझ (एलएलएवीए/क्यूवेन-वीएल), वाक् पहचान (व्हिस्पर) और वाक् संश्लेषण (एक्सटीटीएस) के लिए विस्तारित समर्थन

उपयोगकर्ता समीक्षाएं

  • समीक्षाएं लोड हो रही हैं...