3D-स्पीकर मुफ्त

-

3डी-स्पीकर सिंगल/मल्टीमॉडल स्पीकर सत्यापन, स्पीकर पहचान और स्पीकर लॉग पृथक्करण के लिए अलीबाबा क्लाउड मॉडलस्कोप का ओपन सोर्स टूलकिट है। यह ERes2Net, CAM++, और ECAPA-TDNN जैसे पूर्व-प्रशिक्षित मॉडल और बड़े पैमाने पर 3D-स्पीकर भाषण डेटा सेट प्रदान करता है, और मल्टी-मोडल स्पीकर लॉग का समर्थन करता है जो भाषण और दृष्टि को एकीकृत करता है।

3D-स्पीकर उत्पाद इंटरफेस

3डी-स्पीकर

3डी-स्पीकर के मुख्य पैरामीटर और आँकड़े

3डी-स्पीकर अलीबाबा क्लाउड मॉडलस्कोप समुदाय से एक ओपन सोर्स सिंगल/मल्टी-मोडल स्पीकर सत्यापन, पहचान और लॉग सेपरेशन टूलकिट है। यह स्पीच टेक्नोलॉजी डेवलपर्स और एआई शोधकर्ताओं के लिए मॉडल प्रशिक्षण से लेकर उत्पादन अनुमान तक एक संपूर्ण टूल श्रृंखला प्रदान करता है। इसके नाम में "3डी" त्रि-आयामी दृष्टि के बजाय डेटा सेट के तीन आयामों - मल्टी-डिवाइस, मल्टी-डिस्टेंस और मल्टी-डायलेक्ट का प्रतिनिधित्व करता है।

प्रोजेक्ट्स सार्वजनिक सूचना
उत्पाद स्थिति ओपन सोर्स सिंगल/मल्टी-मोडल स्पीकर सत्यापन और लॉग सेपरेशन टूलकिट
कोर टेक्नोलॉजी स्टैक गहन शिक्षण (ResNet, Res2Net, ECAPA-TDNN, ERes2Net, CAM++, SDPN, आदि)
पूर्व-प्रशिक्षित मॉडलों की संख्या 10+ (वक्ता सत्यापन, भाषा पहचान, स्व-पर्यवेक्षित शिक्षण को कवर करना)
लाइसेंस समझौता अपाचे लाइसेंस 2.0
समर्थित प्लेटफार्म लिनक्स, मैकओएस, डेस्कटॉप, एपीआई
प्रोग्रामिंग भाषाएँ पायथन (54%), शेल (27%), पर्ल (15%), सी++ (3%)
गिटहब स्टार्स ~3,100
गिटहब फोर्क्स ~267
योगदानकर्ता 8 लोग (2026-07 तक)
संबद्ध संगठन अलीबाबा DAMO अकादमी / मॉडलस्कोप
संबंधित स्थान सीएन
लिंक किया गया डेटासेट 3डी-स्पीकर-डेटासेट (10,000+ स्पीकर, 190जीबी प्रशिक्षण डेटा)
अकादमिक पेपर्स आईसीएएसएसपी 2025 स्वीकृति

एक वाक्य में संक्षिप्त समीक्षा: 3डी-स्पीकर एक वॉयस असिस्टेंट उत्पाद नहीं है, बल्कि मॉडलस्कोप द्वारा निर्मित एक पेशेवर वॉयसप्रिंट पहचान ओपन सोर्स टूल लाइब्रेरी है - जो डेवलपर्स को कम लागत पर "आवाज़ सुनकर लोगों की पहचान करने" की उत्पादन-स्तरीय क्षमताओं का निर्माण करने की अनुमति देता है, और इसके मिलान के लिए बड़े पैमाने पर बेंचमार्क डेटा सेट प्रदान करता है।

मुख्य क्षमता सीमा: 3डी-स्पीकर "कौन बोल रहा है" के कार्य पर ध्यान केंद्रित करता है और एएसआर (भाषण से पाठ), टीटीएस (भाषण संश्लेषण) या एनएलपी अर्थ संबंधी समझ प्रदान नहीं करता है। यह वॉइस इंटरेक्शन पाइपलाइन में पहचान पहचान समस्या को हल करता है और एक संपूर्ण संवाद प्रणाली बनाने के लिए इसे अन्य वॉइस मॉड्यूल के साथ संयोजित करने की आवश्यकता होती है।

3डी-स्पीकर की उपयोगकर्ता और बाज़ार मान्यता

वॉयसप्रिंट पहचान तकनीक अकादमिक अनुसंधान से बड़े पैमाने पर औद्योगिक अनुप्रयोग में संक्रमण के एक महत्वपूर्ण चरण में है - वित्तीय पहचान प्रमाणीकरण, बुद्धिमान सम्मेलन विश्लेषण और स्मार्ट होम वैयक्तिकरण जैसे परिदृश्यों में "आवाज़ सुनकर लोगों की पहचान करने" की मांग बढ़ती जा रही है। हालाँकि, उच्च-गुणवत्ता वाले ओपन सोर्स टूल श्रृंखला की कमी ने लंबे समय से औद्योगिक कार्यान्वयन की गति को प्रतिबंधित कर दिया है। इस संदर्भ में, 3डी-स्पीकर मॉडलस्कोप इकोसिस्टम (अलीबाबा क्लाउड का एआई ओपन सोर्स प्लेटफॉर्म) पर निर्भर करता है और चीनी स्पीकर पहचान के क्षेत्र में सबसे प्रभावशाली ओपन सोर्स प्रोजेक्ट्स में से एक बन गया है।

सामुदायिक मान्यता: GitHub रिपॉजिटरी को लगभग 3,100 सितारे और 267 फ़ोर्क प्राप्त हुए। समान ओपन सोर्स प्रोजेक्ट्स (जैसे कि 4.5k स्टार्स के बारे में वीस्पीकर, 9k स्टार्स के बारे में स्पीचब्रेन) की तुलना में, 3डी-स्पीकर को चीनी भाषण प्रौद्योगिकी समुदाय में पहले सोपानक में मान्यता प्राप्त है। मुख्य अंतर यह है कि यह बड़े पैमाने पर मल्टी-डिवाइस/मल्टी-डिस्टेंस/मल्टी-डायलेक्ट डेटा सेट और बेसलाइन मॉडल का एक पूरा सेट का "डेटा + कोड" एकीकृत समाधान प्रदान करता है।

शैक्षणिक प्रभाव: 3डी-स्पीकर से संबंधित कागजात को आईसीएएसएसपी 2025 (भाषण के क्षेत्र में शीर्ष शैक्षणिक सम्मेलन) द्वारा स्वीकार कर लिया गया है, और पेपर का शीर्षक "3डी-स्पीकर-टूलकिट: मल्टी-मोडल स्पीकर सत्यापन और डायराइजेशन के लिए एक ओपन सोर्स टूलकिट" है। साथ में दिया गया 3डी-स्पीकर डेटासेट पेपर (arXiv 2306.15354) भाषण प्रतिनिधित्व डिकॉउलिंग अनुसंधान के लिए 14 चीनी बोलियों में 10,000+ वक्ताओं का एक बड़े पैमाने पर बेंचमार्क प्रदान करता है, और कई शोधकर्ताओं द्वारा उद्धृत किया गया है।

औद्योगिक अंगीकरण: वॉयसप्रिंट पहचान वित्तीय अनुपालन परिदृश्यों में "उन्नत पहचान प्रमाणीकरण" के लिए प्रमुख प्रौद्योगिकियों में से एक है। अलीबाबा क्लाउड इकोसिस्टम पर भरोसा करते हुए, 3डी-स्पीकर मॉडलस्कोप प्लेटफॉर्म के पूर्व-प्रशिक्षित मॉडल डाउनलोड और ऑनलाइन अनुमान सेवाओं के माध्यम से वित्त, सुरक्षा, सम्मेलन और अन्य उद्योगों में डेवलपर उपयोगकर्ताओं को कवर करता है। विशिष्ट एंटरप्राइज़-स्तरीय गोद लेने का डेटा सार्वजनिक नहीं है, लेकिन मॉडलस्कोप प्लेटफ़ॉर्म स्पीकर-सत्यापन मॉडल पृष्ठ के डाउनलोड को अप्रत्यक्ष संदर्भ के रूप में उपयोग किया जा सकता है।

प्रतिस्पर्धी उत्पादों से विभेदक स्थिति: अंतरराष्ट्रीय मुख्यधारा के टूल जैसे कि piannote.audio (फ्रांसीसी टीम द्वारा विकसित, डायराइजेशन पर ध्यान केंद्रित करते हुए), स्पीचब्रेन (व्यापक भाषण टूलकिट), और वीस्पीकर (स्पीकर पहचान पर ध्यान केंद्रित), 3डी-स्पीकर की तुलना में मुख्य लाभ तीन बिंदुओं में निहित हैं: पहला, यह एक बड़े पैमाने पर चीनी बहु-बोली डेटा सेट (3डी-स्पीकर-डेटासेट) प्रदान करता है; दूसरा, इसमें सिंगल-मोडल (शुद्ध ऑडियो) और मल्टी-मोडल (ऑडियो और वीडियो फ्यूजन) दोनों समाधान शामिल हैं; तीसरा, यह ERes2NetV2 और CAM++ जैसे मॉडल आर्किटेक्चर में अग्रणी बेंचमार्क परिणाम बनाए रखना जारी रखता है।

3डी-स्पीकर का लागत लाभ

3डी-स्पीकर का मूल्य निर्धारण मॉडल बेहद सरल है - अपाचे 2.0 ओपन सोर्स लाइसेंस के तहत पूरी तरह से मुफ़्त। लेकिन "ओपन सोर्स और फ्री" के पीछे की वास्तविक लागत संरचना को भूमिका के आधार पर विभाजित करने की आवश्यकता है:

सी-साइड/व्यक्तिगत डेवलपर: कोड और पूर्व-प्रशिक्षित मॉडल डाउनलोड करने और उपयोग करने के लिए पूरी तरह से मुफ़्त है (अपाचे 2.0 लाइसेंस)। व्यक्तिगत डेवलपर्स बिना किसी लाइसेंस शुल्क के देशी जीपीयू (जैसे आरटीएक्स 3090/4090) पर अनुमान चला सकते हैं। 3डी-स्पीकर डेटासेट (~190जीबी) भी निःशुल्क उपलब्ध है, लेकिन डाउनलोड करने के लिए बैंडविड्थ और समय लागत की आवश्यकता होती है।

एपीआई/डेवलपर: कोई आधिकारिक होस्ट किया गया एपीआई मूल्य निर्धारण नहीं - 3डी-स्पीकर मॉडलस्कोप प्लेटफॉर्म पर एक स्टैंडअलोन भुगतान एपीआई की पेशकश नहीं करता है (डीपसीक एपीआई जैसे बेस मॉडल के लिए वाणिज्यिक एपीआई मॉडल के विपरीत)। डेवलपर्स चुन सकते हैं:

  • स्व-परिनियोजन मोड: अपने स्वयं के सर्वर पर अनुमान चलाएं, और लागत पूरी तरह से हार्डवेयर निवेश पर निर्भर करती है। उपभोक्ता-ग्रेड जीपीयू पर एकल स्पीकर सत्यापन अनुमान दसियों मिलीसेकंड में पूरा किया जा सकता है, और थ्रूपुट बाधा मुख्य रूप से फीचर निष्कर्षण से पहले वॉयस एक्टिविटी डिटेक्शन (वीएडी) और ऑडियो डिकोडिंग चरणों में है।
  • मॉडलस्कोप ऑनलाइन अनुमान: मॉडलस्कोप प्लेटफॉर्म कुछ पूर्व-प्रशिक्षित मॉडलों के लिए ऑनलाइन अनुभव सेवाएं प्रदान करता है, लेकिन इसका उपयोग मुख्य रूप से कार्यात्मक सत्यापन के लिए किया जाता है और यह उच्च-समवर्ती उत्पादन परिदृश्यों के लिए उपयुक्त नहीं है। विशिष्ट उपयोग सीमा आधिकारिक मॉडलस्कोप पृष्ठ के अधीन है।

उद्यम/निजी: अपाचे 2.0 लाइसेंस बिना लाइसेंस शुल्क के मुफ्त व्यावसायिक उपयोग, संशोधन और पुनर्वितरण की अनुमति देता है। हालाँकि, उद्यमों को निम्नलिखित स्पष्ट निवेश वहन करने की आवश्यकता है:

  • GPU इंफ्रास्ट्रक्चर: एक एकल कार्ड A100-80G मुख्यधारा के मॉडल जैसे ERes2NetV2 (17.8M पैरामीटर) का बैच अनुमान ले सकता है; बड़े पैमाने पर डायराइज़ेशन कार्यों (जैसे दर्जनों घंटे की कॉन्फ़्रेंस ऑडियो) के लिए उच्च-विनिर्देश सीपीयू/जीपीयू संसाधन कॉन्फ़िगरेशन की आवश्यकता होती है।
  • डेटा संग्रह और एनोटेशन: वॉयसप्रिंट पहचान प्रणाली का वास्तविक प्रदर्शन लक्ष्य दृश्य से मेल खाने वाले डेटा पर अत्यधिक निर्भर है। सभी डिवाइसों (जैसे पीसी माइक्रोफोन से फोन चैनल पर स्विच करना) और दूरियों (निकट क्षेत्र बनाम दूर क्षेत्र) में पहचान सटीकता में काफी कमी आएगी। उद्यमों को आमतौर पर अतिरिक्त रूप से लक्ष्य दृश्य का वॉयस डेटा एकत्र करने और डोमेन फाइन-ट्यूनिंग करने की आवश्यकता होती है। यह छिपी हुई लागत अक्सर मॉडल का उपयोग करने की लागत से अधिक होती है।
  • सिस्टम एकीकरण निवेश: वॉयसप्रिंट पहचान मॉड्यूल को मौजूदा एएसआर, वीएडी, एनएलपी और अन्य पाइपलाइनों के साथ जोड़ना आवश्यक है, जिसमें इंजीनियरिंग जनशक्ति निवेश शामिल है।

लागत तुलना: ओपन सोर्स टूल बनाम वाणिज्यिक एपीआई:

लागत मदें 3डी-स्पीकर (खुला स्रोत और स्व-परिनियोजन) वाणिज्यिक वॉयसप्रिंट एपीआई (जैसे अलीबाबा क्लाउड वॉयसप्रिंट पहचान)
लाइसेंस शुल्क शून्य कॉल वॉल्यूम के अनुसार बिल किया गया
जीपीयू सर्वर (मासिक अनुमान) 5,000-50,000 युआन (पैमाने के आधार पर) शून्य (एपीआई कॉल)
संचालन एवं रखरखाव जनशक्ति इंजीनियर रखरखाव की आवश्यकता शून्य
दृश्य अनुकूलन फाइन-ट्यूनिंग स्व-निवेश अनुकूलन आमतौर पर समर्थित नहीं है
डेटा गोपनीयता पूरी तरह से स्थानीयकृत क्लाउड सेवा प्रदाताओं पर भरोसा करना
पैमाने के बाद सीमांत लागत शून्य के करीब (केवल बिजली लागत) कॉल वॉल्यूम के साथ रैखिक वृद्धि

छिपी लागत युक्ति: 3डी-स्पीकर का ईईआर वोक्ससेलेब और सीएनसेलेब जैसे मानक परीक्षण सेटों पर 0.52% तक कम हो सकता है, लेकिन ये संख्याएं नियंत्रित प्रयोगशाला स्थितियों के तहत प्राप्त की जाती हैं। वास्तविक दुनिया के परिदृश्यों में - गैर-मौन स्थितियाँ, मोबाइल फोन कॉल, बच्चे या बुजुर्ग वक्ता - पहचान सटीकता काफी कम हो जाती है। मॉडल को उत्पादन में डालने से पहले, आपको पूर्व-प्रशिक्षित मॉडल और फाइन-ट्यून किए गए मॉडल के बीच प्रदर्शन अंतर की तुलना करने के लिए लक्ष्य दृश्य डेटा पर कम से कम दो सप्ताह तक ग्रेस्केल परीक्षण करने की आवश्यकता है।

3डी-स्पीकर के मुख्य कार्य

3डी-स्पीकर की मुख्य क्षमताएं "भाषण से वक्ता की पहचान की पहचान" के कार्य के इर्द-गिर्द घूमती हैं और इसमें चार परस्पर संबंधित कार्यात्मक मॉड्यूल शामिल हैं:

  • स्पीकर सत्यापन: 1:1 पहचान प्रमाणीकरण, यह सत्यापित करना कि भाषण किसी घोषित वक्ता का है या नहीं। यह वित्तीय पहचान सत्यापन और सिस्टम लॉगिन के लिए एक मुख्य परिदृश्य है। 3D-स्पीकर ERes2NetV2, CAM++, ECAPA-TDNN इत्यादि जैसे कई मॉडल प्रदान करता है, और VoxCeleb परीक्षण सेट पर EER 0.52% (ERes2Net-Large) से 1.56% (Res2Net) तक होता है। कार्यान्वयन संबंधी चिंताएं: सत्यापन सीमा का चयन सीधे सुरक्षा और उपयोगकर्ता अनुभव से समझौता करता है - यदि सीमा बहुत सख्त है, तो इससे सुरक्षा में सुधार होगा लेकिन उपयोगकर्ता अस्वीकृति दर में वृद्धि होगी। यह निर्धारित करने के लिए व्यावसायिक सुरक्षा स्तर के अनुसार आरओसी वक्र विश्लेषण करने की अनुशंसा की जाती है।

  • स्पीकर पहचान: 1:एन पहचान मिलान, पंजीकृत स्पीकर सेट से यह पहचानना कि वर्तमान आवाज किस ज्ञात पहचान से संबंधित है। यह संदिग्ध जांच और वीआईपी ग्राहकों की स्वचालित पहचान जैसे परिदृश्यों के लिए उपयुक्त है। कार्यान्वयन संबंधी चिंताएँ: जब पंजीकरण सेट का आकार बढ़ता है, तो पहचान सटीकता कम हो जाएगी। बड़े पैमाने के परिदृश्यों (>10,000 लोगों) में, पदानुक्रमित अनुक्रमण या एएनएन त्वरण शुरू करने की अनुशंसा की जाती है।

  • स्पीकर डायराइजेशन: "कौन किस समय बोला", और आउटपुट टाइमस्टैम्प + स्पीकर लेबल के अनुसार बहु-व्यक्ति ऑडियो को विभाजित और लेबल करें। विश्लेषण और ग्राहक सेवा गुणवत्ता निरीक्षण को पूरा करने के लिए यह मुख्य पूर्व-आवश्यक क्षमता है। 3डी-स्पीकर की डायराइजेशन पाइपलाइन में पांच प्लग करने योग्य मॉड्यूल शामिल हैं: ओवरलैपिंग स्पीच डिटेक्शन (वैकल्पिक) → वॉयस एक्टिविटी डिटेक्शन → स्पीच सेगमेंटेशन → स्पीकर एम्बेडिंग एक्सट्रैक्शन → स्पीकर क्लस्टरिंग। ऐशेल-4 डेटा सेट पर, डीईआर (डायराइजेशन एरर रेट) 10.30% तक पहुंच सकता है। कार्यान्वयन संबंधी चिंताएं: ओवरलैप का पता लगाना वर्तमान परियोजना की बाधा है - जब दो या दो से अधिक लोग एक ही समय में बात करते हैं, तो पारंपरिक डायराइजेशन योजना गलत तरीके से ओवरलैपिंग क्षेत्र को किसी एक स्पीकर को निर्दिष्ट कर देगी या इसे शोर के रूप में चिह्नित कर देगी, जिससे सूचना हानि होगी। 3डी-स्पीकर इस समस्या को कम करने के लिए एक वैकल्पिक ओवरलैप डिटेक्शन मॉड्यूल प्रदान करता है।

  • भाषा पहचान: भाषण के भाषा प्रकार की पहचान करें (वर्तमान में चीनी और अंग्रेजी पर ध्यान केंद्रित)। सीएएम++ मॉडल के आधार पर, 3डी-स्पीकर डेटा सेट पर 29.36% का ईईआर हासिल किया जाता है (भाषा पहचान मुख्य रूप से सटीकता पर आधारित है, यह ईईआर केवल संदर्भ के लिए है)। बहुभाषी कॉल सेंटर स्वचालित रूटिंग परिदृश्यों के लिए उपयुक्त।

  • मल्टीमॉडल स्पीकर डायराइजेशन: ऑडियो और वीडियो इमेज इनपुट का फ्यूजन। टॉकनेट-एएसडी मॉडल के माध्यम से वीडियो से होठों की गति और चेहरे की गतिविधि की विशेषताओं को निकाला जाता है, और ओवरलैपिंग भाषण परिदृश्यों में ऑडियो सुविधाओं के साथ संयुक्त अनुमान ऑडियो-केवल समाधान की तुलना में काफी बेहतर है। यह वीडियो कॉन्फ्रेंस और साक्षात्कार रिकॉर्ड जैसे परिदृश्यों के लिए उपयुक्त है जिसमें ऑडियो और वीडियो डेटा दोनों शामिल हैं।

  • स्व-पर्यवेक्षित स्पीकर सत्यापन (स्व-पर्यवेक्षित एसवी): दो स्व-पर्यवेक्षित प्रशिक्षण समाधान, आरडीआईएनओ और एसडीपीएन प्रदान करता है, जो बिना लेबल वाले भाषण डेटा पर स्पीकर प्रतिनिधित्व सीख सकता है, जिससे उच्च गुणवत्ता वाले एनोटेटेड डेटा पर निर्भरता कम हो जाती है। बड़े पैमाने पर बिना लेबल वाले भाषण डेटा पर पूर्व-प्रशिक्षण परिदृश्यों के लिए उपयुक्त।

[विशेषज्ञ दृष्टिकोण: कार्यात्मक तालमेल]: ये चार कार्य एक पूर्ण "भाषण→स्पीकर टैग" प्रसंस्करण पाइपलाइन बनाते हैं - डायराइजेशन विभिन्न वक्ताओं के भाषण खंडों को अलग करता है → सत्यापन/पहचान प्रत्येक खंड को पहचान के साथ लेबल करता है → भाषा पहचान पूरक भाषा मेटा-जानकारी। वास्तविक इंजीनियरिंग परिनियोजन में, डायराइज़ेशन की विभाजन सटीकता (विशेष रूप से ओवरलैपिंग भाषण विभाजन की गुणवत्ता) पूरी पाइपलाइन की बाधा है: विभाजन त्रुटियों को सीधे सत्यापन अनुभागों में भेज दिया जाएगा, जिसके परिणामस्वरूप पहचान एनोटेशन त्रुटियां होंगी। केवल सत्यापन मॉडल की सटीकता पर ध्यान केंद्रित करने के बजाय, VAD और पाइपलाइन के विभाजन में अधिक ट्यूनिंग संसाधनों का निवेश करने की अनुशंसा की जाती है।

3डी-स्पीकर का मॉडल और संस्करण विकास

3डी-स्पीकर को "फंक्शन इटरेशन ड्राइव्स वर्जन इवोल्यूशन" मोड में लगातार अपडेट किया जाता है। GitHub रिपॉजिटरी में पारंपरिक सिमेंटिक संस्करण संख्याएं नहीं हैं (कोई v1.0, v2.0, आदि रिलीज़ नहीं), लेकिन इसे "नए मॉडल या नए कार्यों की मासिक/त्रैमासिक रिलीज़" के रूप में प्रचारित किया जाता है। निम्नलिखित रीडमी में व्हाट्स न्यू टाइमलाइन के आधार पर संस्करण संदर्भ का पुनर्निर्माण है:

चरण 1: डेटा सेट और बेसलाइन मॉडल रिलीज़ (2023.06 - 2023.11)

  • 2023.06: 3डी-स्पीकर डेटासेट आधिकारिक तौर पर जारी किया गया है, जिसमें 14 चीनी बोलियों में 10,000+ स्पीकर, मल्टी-डिवाइस (पीसी, रिकॉर्डर, ऐरे, मोबाइल आईपैड) और मल्टी-डिस्टेंस (0.1 मी-4 मी) लेबल शामिल हैं। उसी समय, बेसलाइन मॉडल और ERes2Net, CAM++ और RDINO जैसे सहायक बेंचमार्क जारी किए गए।
  • 2023.07: CAM++, ERes2Net-Base, और ERes2Net-लार्ज प्री-ट्रेनिंग मॉडल मॉडलस्कोप प्लेटफॉर्म पर लॉन्च किए गए हैं; डायराइजेशन के सिमेंटिक आयाम को बढ़ाने के लिए डायलॉग डिटेक्शन और सिमेंटिक स्पीकर स्विचिंग डिटेक्शन मॉड्यूल जारी किए गए हैं।
  • 2023.08: सीएन-सेलेब डेटा सेट पर CAM++, ERes2Net-Base, और ERes2Net-लार्ज बेंचमार्क परिणाम जारी किए गए; चीनी और अंग्रेजी भाषा पहचान मॉडल जारी किए।
  • 2023.09: सीएन-सेलेब डेटासेट पर RDINO स्व-पर्यवेक्षित स्पीकर सत्यापन मॉडल के लिए प्रशिक्षण और अनुमान रेसिपी जारी की गई।
  • 2023.10: तीन डेटासेट (3डी-स्पीकर, वोक्ससेलेब, सीएन-सेलेब) पर ईसीएपीए-टीडीएनएन के प्रशिक्षण और अनुमान व्यंजनों को जारी किया।
  • 2023.11: ERes2Net-बेस पूर्व-प्रशिक्षित मॉडल जारी किया गया, जो 200k स्पीकर चीनी मंदारिन डेटासेट पर आधारित है।

चरण 2: मॉडल सिस्टम विस्तार (2024.01 - 2024.08)

  • 2024.01: तीन डेटा सेटों को कवर करते हुए ResNet34 और Res2Net मॉडल रेसिपी जारी की गई; बड़े मार्जिन वाली फ़ाइनट्यून रेसिपी और डायराइज़ेशन अनुमान रेसिपी जारी की गईं।
  • 2024.02: एक भाषा पहचान नुस्खा जारी किया गया जो भाषा पहचान सटीकता में सुधार करने के लिए ध्वनि सूचना को एकीकृत करता है; ऑडियो और वीडियो इनपुट को एकीकृत करने के लिए एक मल्टी-मॉडल डायराइजेशन रेसिपी जारी की।
  • 2024.04: ओएनएनएक्स रनटाइम अनुमान रनटाइम जारी किया, जो ओएनएनएक्स प्रारूप में मॉडल निर्यात और सीपीयू/एज उपकरणों पर कुशल अनुमान का समर्थन करता है; VoxCeleb पर कम मापदंडों और तेज़ अनुमान के साथ ERes2NetV2 मॉडल जारी किया।
  • 2024.05: एसडीपीएन स्व-पर्यवेक्षित मॉडल एक्स-वेक्टर मॉडल प्रशिक्षण और अनुमान व्यंजन जारी किया गया; मल्टी-मोडल स्पीकर धारणा क्षमताओं का विस्तार करने के लिए विज़न मॉड्यूल (टॉकनेट-एएसडी) और सिमेंटिक मॉड्यूल (बीईआरटी) रेसिपी जारी की गई।
  • 2024.08: ERes2NetV2 और ERes2NetV2_w24s4ep4 पूर्व-प्रशिक्षित मॉडल जारी किए गए, जिन्हें EER और पैरामीटर आकार के बीच बेहतर संतुलन प्राप्त करने के लिए 200k स्पीकर डेटासेट पर प्रशिक्षित किया गया।

तीसरा चरण: इंजीनियरिंग और बेंचमार्क सुधार (2024.12)

  • 2024.12: ऐशेल-4, अलीमीटिंग, एएमआई, वोक्सकॉनवर्स, मीटिंग-सीएन इत्यादि जैसे कई सार्वजनिक मल्टी-स्पीकर डेटासेट पर प्रतिलिपि प्रस्तुत करने योग्य डीईआर बेंचमार्क प्रदान करने के लिए पूरी तरह से अद्यतन डायराइजेशन नुस्खा। यह नवीनतम प्रमुख संस्करण है और एक शुद्ध अनुसंधान उपकरण से एक प्रतिलिपि प्रस्तुत करने योग्य इंजीनियरिंग बेंचमार्क में 3डी-स्पीकर के परिवर्तन का प्रतीक है।

संस्करण नीति वक्तव्य: 3डी-स्पीकर सिमेंटिक संस्करण संख्या रिलीज का पालन नहीं करता है, और GitHub रिलीज पेज पर कोई आधिकारिक रिलीज रिकॉर्ड नहीं है। उपयोगकर्ताओं को नवीनतम परिवर्तनों को ट्रैक करने के लिए Git Commit इतिहास मॉडलस्कोप मॉडल पेज और README अपडेट लॉग पर ध्यान देना चाहिए। यह रिलीज़ विधि रखरखाव लागत को कम करती है, लेकिन यह उपयोगकर्ताओं के लिए एकल संस्करण संख्या के माध्यम से कोड स्थिरता का आकलन करना भी मुश्किल बना देती है - उत्पादन उपयोग के लिए विशिष्ट प्रतिबद्धताओं को लॉक करने की अनुशंसा की जाती है।

3डी-स्पीकर के तकनीकी लाभ

3डी-स्पीकर का तकनीकी लाभ न केवल एक निश्चित मॉडल आर्किटेक्चर की सफलता में निहित है, बल्कि डेटा से मॉडल तक, प्रशिक्षण से लेकर तैनाती तक संपूर्ण लिंक कवरेज में भी निहित है। निम्नलिखित को वास्तुशिल्प नवाचार और इंजीनियरिंग के दो आयामों से अलग किया गया है।

मॉडल आर्किटेक्चर वंशावली: 3डी-स्पीकर 8+ स्पीकर सत्यापन मॉडल आर्किटेक्चर को एकीकृत करता है, जो विभिन्न पैमानों और एप्लिकेशन परिदृश्यों को कवर करता है:

मॉडल पैरामीटर्स वॉक्ससेलेब ईईआर सीएनसेलेब ईईआर 3डीस्पीकर ईईआर विशेषताएँ
Res2Net 4.03एम 1.56% 7.96% 8.03% हल्के आधार रेखा
रेसनेट34 6.34एम 1.05% 6.92% 7.29% क्लासिक वास्तुकला
ईसीएपीए-टीडीएनएन 20.8M 0.86% 8.01% 8.87% प्रतिस्पर्धी आधार रेखा
ERes2Net-आधार 6.61एम 0.84% ​​ 6.69% 7.21% उच्च लागत प्रदर्शन
सीएएम++ 7.2एम 0.65% 6.78% 7.75% कुशल कनवल्शन
ERes2NetV2 17.8एम 0.61% 6.14% 6.52% उच्च परिशुद्धता अनुशंसा
ERes2Net-बड़े 22.46एम 0.52% 6.17% 6.34% उच्चतम सटीकता

तंत्र की कारण श्रृंखला → प्रभाव → दृश्य: स्पीकर सत्यापन का तकनीकी मूल चर-लंबाई भाषण से निश्चित-आयामी "भेदभावपूर्ण स्पीकर एम्बेडिंग" (स्पीकर एंबेडिंग) निकालना है। ERes2NetV2 अवशिष्ट कनेक्शन के पदानुक्रमित डिज़ाइन के माध्यम से बहु-स्तरीय समय-आवृत्ति सुविधाओं को एकीकृत करता है, जिससे EER को 0.84% ​​(ERes2Net-बेस) से 0.61% तक कम करते हुए मापदंडों की संख्या 14% कम हो जाती है। इसका मतलब यह है कि ऐसे परिदृश्यों में जहां त्रुटि दर शून्य के करीब है (जैसे वित्तीय जोखिम नियंत्रण), ERes2NetV2 कम कम्प्यूटेशनल लागत पर समान सुरक्षा सीमा प्राप्त कर सकता है। इसके लागू परिदृश्य उत्पादन वातावरण हैं जिनके लिए उच्च-परिशुद्धता स्पीकर सत्यापन की आवश्यकता होती है और अनुमान में देरी के प्रति संवेदनशील होते हैं।

CAM++ के अभिनव लाभ: CAM++ (प्रासंगिक ध्यान मॉड्यूल) 3डी-स्पीकर टीम द्वारा प्रस्तावित एक कुशल कन्वेन्शनल आर्किटेक्चर है। यह 7.2M की बेहद कम पैरामीटर मात्रा के साथ VoxCeleb पर 0.65% EER तक पहुंचता है, जो ERes2NetV2 (17.8M) के स्तर तक पहुंचता है। पैरामीटर दक्षता (ईईआर/पैरामीटर राशि अनुपात) सभी मॉडलों में सबसे अधिक है। वॉयसप्रिंट पहचान परिदृश्यों के लिए जिन्हें उपकरणों या मोबाइल उपकरणों पर तैनात करने की आवश्यकता है, CAM++ प्राथमिकता मूल्यांकन के लिए सबसे योग्य है।

डायराइजेशन पाइपलाइन इंजीनियरिंग: 3डी-स्पीकर का डायराइजेशन एक मॉड्यूलर पाइपलाइन डिजाइन को अपनाता है, और प्रत्येक चरण को स्वतंत्र रूप से बदला या अनुकूलित किया जा सकता है:

  • ओवरलैपिंग स्पीच डिटेक्शन (अनुक्रम लेबलिंग मॉडल के आधार पर) → उन क्षेत्रों की पहचान करने के लिए वैकल्पिक मॉड्यूल जहां एक ही समय में कई लोग बोल रहे हैं
  • वॉयस एक्टिविटी डिटेक्शन (वीएडी) → मूक और गैर-वाक् क्लिप हटाएं
  • स्पीकर विभाजन (बीईआरटी या फिक्स्ड विंडो के आधार पर) → भाषण को स्पीकर-सजातीय खंडों में विभाजित करें
  • स्पीकर एम्बेडिंग निष्कर्षण → सेगमेंट-स्तरीय एम्बेडिंग निकालने के लिए ERes2NetV2/CAM++ जैसे मॉडल का उपयोग करें
  • स्पीकर क्लस्टरिंग (वर्णक्रमीय क्लस्टरिंग/एफ़िनिटी प्रसार) → विभिन्न स्पीकर में क्लस्टर एम्बेडिंग

ऐशेल-4 और अलीमीटिंग बेंचमार्क पर, पाइपलाइन ने क्रमशः 10.30% और 19.73% का डीईआर हासिल किया, जो समान अवधि में कालडी बेसलाइन (क्रमशः लगभग 12.2% और 24.4%) से काफी बेहतर है, जो मॉड्यूलर डिजाइन के सहक्रियात्मक लाभों की पुष्टि करता है।

मल्टी-मोडल फ़्यूज़न तंत्र: 3डी-स्पीकर का ऑडियो और वीडियो फ़्यूज़न डायराइज़ेशन समाधान टॉकनेट-एएसडी के माध्यम से वीडियो से होंठों की गति और चेहरे की गतिविधि सुविधाओं को निकालता है, उन्हें एम्बेडिंग स्तर पर ऑडियो सुविधाओं के साथ जोड़ता है, और फिर उन्हें एक एकीकृत क्लस्टरिंग मॉड्यूल में भेजता है। ओवरलैपिंग भाषण के उच्च अनुपात वाले परिदृश्यों में, दृश्य जानकारी स्पीकर को सीमा संकेत स्विचिंग प्रदान करती है जहां ऑडियो गायब है, जिससे डीईआर लगभग 3-5 प्रतिशत अंक कम हो जाता है। लागू परिदृश्यों में वीडियो कॉन्फ्रेंसिंग, लाइव साक्षात्कार, समाचार कार्यक्रम और मल्टी-कैमरा वीडियो डेटा वाले अन्य क्षेत्र शामिल हैं।

ONNX रनटाइम परिनियोजन अनुकूलन: 3D-स्पीकर ONNX मॉडल निर्यात और अनुमान स्क्रिप्ट प्रदान करता है, जो PyTorch-प्रशिक्षित मॉडलों को ONNX प्रारूप में बदलने और CPU या एज डिवाइस पर परिनियोजन का समर्थन करता है। मॉडल को मात्रात्मक रूप से अनुकूलित करने के बाद, अनुमान विलंबता को PyTorch गतिशील ग्राफ़ के 1/3 से 1/2 तक कम किया जा सकता है, और मेमोरी का उपयोग लगभग 40% कम हो जाता है। जीपीयू-कम सर्वर वातावरण में, उत्पादन वातावरण में वॉयसप्रिंट पहचान क्षमताओं को लाने के लिए ओएनएनएक्स परिनियोजन सबसे कम लागत वाला मार्ग है।

सीमाएँ और अनुकूलन सीमाएँ: 3डी-स्पीकर का पूर्व-प्रशिक्षित मॉडल मुख्य रूप से 16kHz की नमूना दर के साथ भाषण संकेतों पर उन्मुख है (8kHz टेलीफोन भाषण के लिए अतिरिक्त अनुकूलन की आवश्यकता होती है), और वर्तमान मॉडल चीनी और अंग्रेजी दृश्यों में सबसे अच्छा काम करता है। छोटी भाषाओं, अति-निम्न संसाधन भाषाओं, या अपरंपरागत नमूना दरों वाले परिदृश्यों के लिए, लक्ष्य डेटा पर पूर्व-प्रशिक्षण या फ़ाइन-ट्यून करने के लिए एक स्व-पर्यवेक्षित योजना (RDINO/SDPN) का उपयोग करने की आवश्यकता होती है।

3डी-स्पीकर का उपयोग कैसे करें

3डी-स्पीकर दो उपयोग पथ प्रदान करता है: स्थानीय कोड रनिंग और मॉडलस्कोप प्लेटफ़ॉर्म ऑनलाइन अनुमान।

पथ 1: स्थानीय क्लोन कोड चलाएँ (डेवलपर्स के लिए अनुशंसित)

# क्लोन रिपोजिटरी
गिट क्लोन https://github.com/modelscope/3D-Speaker.git
सीडी 3डी-स्पीकर

# Python 3.8 संदर्भ बनाएं और निर्भरताएं स्थापित करें
कोंडा क्रिएट -एन 3डी-स्पीकर पायथन=3.8
कोंडा 3डी-स्पीकर सक्रिय करें
पिप इंस्टॉल -आर आवश्यकताएँ.txt

प्रशिक्षण नुस्खा का उदाहरण (उदाहरण के तौर पर 3डी-स्पीकर डेटासेट पर ERes2NetV2 का स्पीकर सत्यापन लेते हुए):

सीडी उदाहरण/3dspeaker/sv-eres2netv2/
बैश रन.श

अनुमान के लिए पूर्व-प्रशिक्षित मॉडल का उपयोग करें: मॉडलस्कोप लाइब्रेरी के माध्यम से अनुमान के लिए पूर्व-प्रशिक्षित मॉडल को लोड करें:

पिप इंस्टाल मॉडलस्कोप
# एकल-फ़ाइल स्पीकर सत्यापन अनुमान
मॉडल_आईडी = "iic/speech_eres2netv2_sv_zh-cn_16k-common"
पायथन स्पीकरलैब/बिन/infer_sv.py --model_id $model_id

# बैच अनुमान
पायथन स्पीकरलैब/बिन/infer_sv_batch.py --model_id $model_id --wavs wav_list.txt

# स्व-पर्यवेक्षित मॉडल अनुमान (एसडीपीएन, वोक्ससेलेब प्रशिक्षण पर आधारित)
मॉडल_आईडी = "iic/speech_sdpn_ecapa_tdnn_sv_en_voxceleb_16k"
पायथन स्पीकरलैब/बिन/infer_sv_ssl.py --model_id $model_id

स्पीकर लॉग अनुमान (डायराइजेशन):

# शुद्ध ऑडियो डायरीकरण
पायथन स्पीकरलैब/बिन/infer_diarization.py --wav ऑडियो.wav --out_dir ./output

# ओवरलैपिंग स्पीच डिटेक्शन सक्षम करें (हगिंगफेस टोकन की आवश्यकता है)
पायथन स्पीकरलैब/बिन/infer_diarization.py --wav ऑडियो.wav --out_dir ./output \
  --include_overlap --hf_access_token $hf_access_token

पथ 2: मॉडलस्कोप ऑनलाइन अनुभव

[मॉडलस्कोप स्पीकर सत्यापन मॉडल पृष्ठ] (https://www.modelscope.cn/models, page=1&tasks=speaker-verification&type=audio) पर जाएं, संबंधित पूर्व-प्रशिक्षित मॉडल का चयन करें, और परीक्षण के लिए ऑडियो ऑनलाइन अपलोड करें। मॉडल क्षमताओं के त्वरित सत्यापन के लिए उपयुक्त है, लेकिन उत्पादन संदर्भ एकीकरण के लिए उपयुक्त नहीं है।

पथ तीन: ONNX परिनियोजन (एज डिवाइस/सीपीयू अनुमान)

सीडी रनटाइम/ऑनएक्सरनटाइम
# PyTorch मॉडल को ONNX पर निर्यात करने और अनुमान चलाने के लिए इस निर्देशिका में दस्तावेज़ देखें

उपलब्ध पूर्व-प्रशिक्षित मॉडलों की सूची (सभी मॉडलस्कोप के माध्यम से वितरित):

मॉडल आईडी विवरण डेटासेट
iic/speech_eres2net_sv_zh-cn_16k-common ERes2Net, 200k स्पीकर मंदारिन चीनी
iic/speech_eres2netv2_sv_zh-cn_16k-common ERes2NetV2, 200k स्पीकर मंदारिन चीनी
iic/speech_campplus_sv_zh-cn_16k-common CAM++, 200k स्पीकर मंदारिन चीनी
iic/speech_sdpn_ecapa_tdnn_sv_en_voxceleb_16k एसडीपीएन स्व-निगरानी वॉक्ससेलेब (अंग्रेजी)
iic/speech_campplus_lre_en-cn_16k CAM++ भाषा पहचान चीनी और अंग्रेजी
iic/speech_eres2net_base_lre_en-cn_16k ERes2Net भाषा पहचान चीनी और अंग्रेजी

3डी-स्पीकर डेटा सेट डाउनलोड:

# प्रशिक्षण सेट (~190जीबी)
wget https://speech-lab-share-data.oss-cn-shenghai.aliyuncs.com/3D-Speaker/train.tar.gz
# टेस्ट सेट (~1.1जीबी)
wget https://speech-lab-share-data.oss-cn-shenghai.aliyuncs.com/3D-Speaker/test.tar.gz
# पाठ प्रतिलेखित करें
wget https://speech-lab-share-data.oss-cn-shenghai.aliyuncs.com/3D-Speaker/transscription.tar.gz

टिप्स: 3डी-स्पीकर में आधिकारिक डॉकर छवि नहीं है, और आधिकारिक दस्तावेज मुख्य रूप से चीनी रीडमी है। उत्पादन उपयोगकर्ताओं के लिए, निर्भरता संस्करण परिवर्तनों के कारण होने वाले असंगत व्यवहार से बचने के लिए एक विशिष्ट Git कमिट को लॉक करने और स्वयं डॉकर छवि बनाने की अनुशंसा की जाती है।

3डी-स्पीकर के लिए उत्पाद मूल्य निर्धारण

3डी-स्पीकर अपाचे 2.0 ओपन सोर्स प्रोटोकॉल को अपनाता है और इसका कोई वाणिज्यिक चार्जिंग मॉडल नहीं है। विशिष्ट शर्तें:

  • उपयोग का दायरा: सॉफ़्टवेयर का स्वतंत्र रूप से उपयोग करने, प्रतिलिपि बनाने, संशोधित करने, विलय करने, वितरित करने, उपलाइसेंस देने और/या प्रतियां बेचने की अनुमति दी गई है।
  • व्यावसायिक प्रतिबंध: कोई नहीं - अपाचे 2.0 प्रोटोकॉल वाणिज्यिक-अनुकूल है और इसके लिए ओपन सोर्स व्युत्पन्न कार्यों की आवश्यकता नहीं है।
  • एट्रिब्यूशन आवश्यकताएँ: व्युत्पन्न कार्यों में मूल कॉपीराइट नोटिस और योगदानकर्ता सूची को बनाए रखें।
  • वारंटी अस्वीकरण: जहां लागू कानून द्वारा आवश्यक हो या लिखित रूप से सहमति हो, वहां कोई व्यक्त या निहित वारंटी प्रदान नहीं की जाती है।
  • मॉडल वेट लाइसेंस: पूर्व-प्रशिक्षित मॉडल वेट मॉडलस्कोप प्लेटफॉर्म पर होस्ट किए जाते हैं, और उनके उपयोग की शर्तें मॉडलस्कोप के संबंधित मॉडल कार्ड पेज पर बताए गए लाइसेंस के अधीन हैं, जो कोड रिपॉजिटरी के अपाचे 2.0 समझौते से भिन्न हो सकती हैं।
  • डेटासेट लाइसेंस: 3D-स्पीकर डेटासेट मेटाडेटा CC BY-SA 4.0 लाइसेंस के तहत जारी किया गया है, और ऑडियो सामग्री का मूल कॉपीराइट मूल डेटा स्वामी का है।

मूल्य संदर्भ: शून्य लाइसेंस शुल्क। एंटरप्राइज़ उपयोगकर्ताओं के लिए कुल स्वामित्व लागत गणना सूत्र है: टीसीओ = जीपीयू/सर्वर खरीद या किराये का शुल्क + संचालन और रखरखाव जनशक्ति × महीनों की संख्या + परिदृश्य अनुकूलन डेटा संग्रह लागत। प्रति दिन 1,000 घंटे से कम ऑडियो संसाधित करने वाले मध्यम स्तर के परिदृश्यों के लिए, स्व-परिनियोजन का टीसीओ पे-एज़-यू-गो वाणिज्यिक एपीआई की तुलना में काफी कम है।

3डी-स्पीकर के अनुप्रयोग परिदृश्य

वॉयसप्रिंट पहचान को प्रयोगशाला से औद्योगिक कार्यान्वयन की ओर ले जाने के लिए मुख्य चालक तीन दिशाओं से आते हैं: अनुपालन पहचान प्रमाणीकरण, कॉन्फ्रेंस इंटेलिजेंस और स्मार्ट होम वैयक्तिकरण। निम्नलिखित 3डी-स्पीकर की क्षमताओं की सीमाओं पर आधारित एक परिदृश्य-आधारित विश्लेषण है।

  • वित्तीय पहचान प्रमाणीकरण और धोखाधड़ी की रोकथाम: टेलीफोन बैंकिंग और मोबाइल ग्राहक सेवा जैसे दूरस्थ पहचान सत्यापन परिदृश्यों में, वॉयसप्रिंट सत्यापन पासवर्ड/पिन कोड के पूरक या विकल्प के रूप में कार्य करता है। उपयोगकर्ता की कॉल के पहले 3-5 सेकंड के भीतर पहचान की तुलना पूरी करने के लिए 3डी-स्पीकर के स्पीकर सत्यापन मॉडल को आईवीआर सिस्टम में एकीकृत किया जा सकता है। लागत में कमी और दक्षता में सुधार: वॉयसप्रिंट सत्यापन की शुरुआत से पहले, वित्तीय ग्राहक सेवा पासवर्ड रीसेट और पहचान सत्यापन के लिए औसतन 45-60 सेकंड के मैन्युअल प्रसंस्करण समय की आवश्यकता होती थी; वॉयसप्रिंट सत्यापन को एकीकृत करने के बाद, नियमित पहचान सत्यापन स्वचालित रूप से 10 सेकंड के भीतर पूरा किया जा सकता है (वॉयस गतिविधि का पता लगाना + फीचर निष्कर्षण + तुलना सहित), जिससे मैन्युअल हस्तक्षेप लगभग 70% कम हो जाता है। सत्यापन के मुख्य बिंदु: टेलीफोन चैनल के तहत पहचान सटीकता (8kHz नमूना दर), छोटी आवाज में प्रामाणिकता अस्वीकृति दर (<3 सेकंड) परिदृश्य, और अनैच्छिक रिकॉर्डिंग (धोखेबाजों द्वारा निभाई गई रिकॉर्डिंग) के लिए लाइवनेस डिटेक्शन डिफेंस क्षमताएं। 3डी-स्पीकर स्वयं एक एंटी-स्पूफिंग मॉड्यूल प्रदान नहीं करता है और इसके लिए एएसवीस्पूफ जैसे लाइव डिटेक्शन समाधानों के अतिरिक्त एकीकरण की आवश्यकता होती है।

  • मीटिंग विश्लेषण और इंटेलिजेंट मिनट्स: एंटरप्राइज मीटिंग रिकॉर्डिंग स्वचालित रूप से अलग-अलग स्पीकर के वॉयस क्लिप को अलग करती है, और स्पीकर लेबल के साथ मीटिंग मिनट उत्पन्न करने के लिए एएसआर के साथ जोड़ती है। 3डी-स्पीकर की डायराइज़ेशन पाइपलाइन इस परिदृश्य के केंद्र में है। लागत में कमी और दक्षता में सुधार: परंपरागत रूप से, 1 घंटे की बैठक के मिनटों को मैन्युअल रूप से संकलित करने में लगभग 2-3 घंटे लगते हैं; स्वचालित डायराइजेशन + एएसआर पाइपलाइन का उपयोग करके, 1 घंटे की ऑडियो प्रोसेसिंग 15-30 मिनट में पूरी की जा सकती है, और दक्षता 4-10 गुना बढ़ जाती है (जीपीयू अनुमान समय के आधार पर)। सत्यापन फोकस: जब कई लोग एक ही समय में बोलते हैं (अतिव्यापी भाषण) तो विभाजन सटीकता - सम्मेलन कक्षों में सामान्य "व्यवधान" और "एक साथ भाषण" परिदृश्य। पारंपरिक डायराइज़ेशन समाधान ओवरलैपिंग क्षेत्र को गलत स्पीकर के रूप में चिह्नित करेगा। सुधार समाधान को 3डी-स्पीकर के वैकल्पिक ओवरलैप डिटेक्शन मॉड्यूल द्वारा कम करने की आवश्यकता है। वीडियो कॉन्फ्रेंसिंग के लिए, ओवरलैपिंग दृश्यों की पहचान मजबूती में सुधार करने के लिए मल्टी-मोडल डायराइजेशन (ऑडियो और वीडियो फ़्यूज़न) को सक्षम करने की अनुशंसा की जाती है। मानव-मशीन सहयोग सीमा: स्वचालित लेबलिंग परिणामों के लिए मैन्युअल समीक्षा स्थापित करने की अनुशंसा की जाती है - 20% ओवरलैप परिदृश्य में स्पीकर लेबलिंग त्रुटियां अभी भी 5-10% तक पहुंच सकती हैं, और अनुपालन के लिए आवश्यक मीटिंग रिकॉर्ड मैन्युअल रूप से पुष्टि की जानी चाहिए।

  • स्मार्ट स्पीकर और घरेलू वैयक्तिकरण: परिवार के विभिन्न सदस्यों की आवाज़ पहचानें, वैयक्तिकृत सामग्री अनुशंसाएँ प्रदान करें और अनुमति नियंत्रण संचालित करें। 3डी-स्पीकर का हल्का मॉडल (सीएएम++, 7.2एम पैरामीटर) क्लाउड कॉल की आवश्यकता के बिना स्मार्ट स्पीकर के एंड-साइड चिप पर चल सकता है। लागत में कमी और दक्षता में सुधार: क्लाउड समाधान की तुलना में, ऑन-डिवाइस वॉयसप्रिंट पहचान एकल इंटरैक्शन के लिए 200-500ms नेटवर्क ट्रांसमिशन विलंब को बचाती है, और कोई क्लाउड अनुमान लागत नहीं है। प्रति दिन 50 बार/10 मिलियन घरेलू उपयोगकर्ताओं के आधार पर, वार्षिक क्लाउड अनुमान लागत बचत लगभग 50-100 मिलियन युआन (0.001 युआन के एक बार के रूप में गणना) है। सत्यापन फोकस: जब परिवार के सदस्यों की संख्या 2 से बढ़ाकर 6 कर दी जाती है तो पहचान स्थिरता; सुदूर क्षेत्र (>2 मीटर) और शोर वातावरण (रसोई का धुआं, टीवी पृष्ठभूमि ध्वनि) में ईईआर गिरावट की डिग्री। 3डी-स्पीकर पूर्व-प्रशिक्षित मॉडल मुख्य रूप से 16kHz निकट-क्षेत्र दृश्य को अनुकूलित करता है, और 3डी-स्पीकर डेटासेट के लंबी दूरी के सबसेट का उपयोग करके दूर-क्षेत्र को ठीक करने की आवश्यकता होती है।

  • कॉल सेंटर गुणवत्ता निरीक्षण: ग्राहक सेवा और ग्राहकों के बीच वार्तालाप खंडों को स्वचालित रूप से अलग करें, और ग्राहक सेवा की भाषण गति, भावना और सेवा शर्तों पर गुणवत्ता निरीक्षण विश्लेषण करें। सत्यापन के मुख्य बिंदु: टेलीफोन परिदृश्यों में नमूनाकरण दर अनुकूलन (8kHz बनाम 16kHz); जब ग्राहक सेवा और ग्राहक की आवाजें अत्यधिक समान हों तो पृथक्करण सटीकता। प्रारंभिक टेम्पलेट के रूप में 3D-स्पीकर के ECAPA-TDNN या ResNet34 मॉडल (CNCeleb फ़ोन डेटा पर बेंचमार्क परिणामों के साथ) का उपयोग करने की अनुशंसा की जाती है।

  • सार्वजनिक अभियोजन और कानूनी साक्ष्य संग्रह: साक्ष्य विश्लेषण में सहायता के लिए ऑडियो साक्ष्य में विभिन्न वक्ताओं को पहचानें और अलग करें। सत्यापन फोकस: कानूनी अनुपालन आवश्यकताओं के तहत व्याख्या - वर्णक्रमीय क्लस्टरिंग परिणामों की पृथक्करण सीमाओं का पता लगाने की आवश्यकता है। 3डी-स्पीकर की वर्तमान क्लस्टरिंग प्रक्रिया विस्तृत आत्मविश्वास आउटपुट प्रदान नहीं करती है, और साक्ष्य संग्रह प्रक्रिया में मैन्युअल समीक्षा को पूरक करने की आवश्यकता है। यह परिदृश्य वक्ताओं की संख्या के पूर्व ज्ञान पर बहुत अधिक निर्भर करता है (अधिकांश क्लस्टरिंग एल्गोरिदम को वक्ताओं की संख्या पूर्व निर्धारित करने या जटिल अनुमानकों का उपयोग करने की आवश्यकता होती है)। चरण 2 में आत्मीयता प्रसार जैसे स्वचालित अनुमान क्लस्टरिंग एल्गोरिदम का उपयोग करने की अनुशंसा की जाती है।

3डी-स्पीकर के लागू समूह

3डी-स्पीकर को एक पेशेवर स्तर के ओपन सोर्स टूल के रूप में तैनात किया गया है, और इसकी उपयोगकर्ता प्रोफ़ाइल सामान्य अंतिम उपभोक्ताओं के बजाय वॉयस टेक्नोलॉजी के क्षेत्र में डेवलपर्स और शोधकर्ताओं पर केंद्रित है।

  • वॉयस टेक्नोलॉजी डेवलपर्स और इंटीग्रेटर्स: तकनीकी टीमें जिन्हें उत्पादों में वॉयसप्रिंट पहचान क्षमताओं को एकीकृत करने की आवश्यकता होती है। पाइपलाइन का उपयोग करने की अनुशंसा की जाती है - पूर्व-प्रशिक्षित मॉडल को स्वयं प्रशिक्षित किए बिना अनुमान के लिए लोड करने के लिए सीधे मॉडलस्कोप का उपयोग करें। सामान्य एकीकरण चक्र लगभग 2-4 सप्ताह का होता है (मॉडल सत्यापन और एपीआई पैकेजिंग सहित)। सीमा के लिए उपयुक्त नहीं: इसमें पायथन/शेल प्रोग्रामिंग और डीप लर्निंग फाउंडेशन के लिए स्पष्ट आवश्यकताएं हैं, और एआई इंजीनियरिंग अनुभव के बिना फ्रंट-एंड या फुल-स्टैक डेवलपर्स के लिए उपयुक्त नहीं है; यदि आपको शुद्ध HTTP एपीआई कॉल की आवश्यकता है और स्व-परिनियोजन स्वीकार नहीं करते हैं, तो आपको वाणिज्यिक वॉयसप्रिंट पहचान एपीआई का मूल्यांकन करना चाहिए।

  • एआई शोधकर्ता (स्पीकर पहचान दिशा): वॉयसप्रिंट पहचान, वॉयस बायोमेट्रिक्स और स्व-पर्यवेक्षित प्रतिनिधित्व सीखने में लगे शोधकर्ता। 3डी-स्पीकर 3डी-स्पीकर, वोक्ससेलेब या सीएनसेलेब डेटासेट पर एसओटीए परिणामों को तुरंत पुन: पेश करने के लिए प्रशिक्षण व्यंजनों और बेंचमार्क का एक पूरा सेट प्रदान करता है। पूर्वापेक्षा: PyTorch और गहन शिक्षण प्रशिक्षण प्रक्रिया से परिचित। आपके निजी डेटा पर पूर्व-प्रशिक्षण के लिए RDINO या SDPN स्व-पर्यवेक्षित योजनाओं का उपयोग करने की अनुशंसा की जाती है।

  • वित्त/सुरक्षा प्रौद्योगिकी टीम: एंटरप्राइज टीमें जिन्हें पहचान प्रमाणीकरण या ऑडियो फोरेंसिक परिदृश्यों में वॉयसप्रिंट सत्यापन क्षमताओं की आवश्यकता होती है। अनुशंसित पथ: पहले लक्ष्य दृश्य डेटा (विशिष्ट माइक्रोफोन, परिवेशी शोर) पर पीओसी करने के लिए पूर्व-प्रशिक्षित मॉडल का उपयोग करें, सत्यापित करें कि सटीकता की आवश्यकताएं पूरी हो गई हैं, और फिर इसे उत्पादन एकीकरण में डाल दें। अनफ़िट सीमा: ऐसे परिदृश्य जिनमें संपूर्ण लाइव बॉडी डिटेक्शन (एंटी-स्पूफिंग) फ़ंक्शन की आवश्यकता होती है, उन्हें 3डी-स्पीकर द्वारा प्रदान नहीं किया जाता है, और एएसवीस्पूफ या अन्य एंटी-स्पूफिंग इंजनों को अतिरिक्त रूप से एकीकृत करने की आवश्यकता होती है।

  • स्मार्ट हार्डवेयर और IoT टीम: स्मार्ट स्पीकर, पहनने योग्य उपकरणों और वाहन प्रणालियों में एंड-साइड वॉयसप्रिंट पहचान तैनात करें। CAM++ मॉडल 7.2M पैरामीटर के हल्के लाभ के साथ संसाधन-बाधित किनारे वाले उपकरणों के लिए उपयुक्त है। पूर्वापेक्षा: मॉडल परिमाणीकरण और ONNX/TensorRT परिनियोजन में अनुभव आवश्यक है।

  • कॉन्फ्रेंसिंग प्रणाली और सहयोग उपकरण डेवलपर्स: ऐसी टीमें जिन्हें अपने कॉन्फ्रेंसिंग उत्पाद अनुभव को बेहतर बनाने के लिए स्वचालित स्पीकर लॉगिंग कार्यक्षमता की आवश्यकता होती है। पीओसी को पूरा करने के लिए डायराइजेशन रेसिपी से शुरुआत करने और पूर्व-प्रशिक्षित मॉडल + वर्णक्रमीय क्लस्टरिंग का उपयोग करने की अनुशंसा की जाती है। अनुपयुक्त सीमा: अत्यधिक उच्च वास्तविक समय आवश्यकताओं (देरी <500ms) के साथ स्ट्रीमिंग परिदृश्य - वर्तमान डायराइजेशन पाइपलाइन को क्लस्टरिंग करने के लिए पूर्ण ऑडियो की आवश्यकता होती है, और फ्रेम-दर-फ्रेम आउटपुट स्ट्रीमिंग प्रोसेसिंग के लिए उपयुक्त नहीं है। यदि आपको स्ट्रीमिंग समाधान की आवश्यकता है, तो आपको क्लस्टरिंग एल्गोरिदम को ऑनलाइन संस्करण में संशोधित करना होगा।

वैश्विक अनफिट सीमा सारांश: 3डी-स्पीकर एएसआर (भाषण से पाठ), टीटीएस (भाषण संश्लेषण) या एनएलयू (प्राकृतिक भाषा समझ) क्षमताएं प्रदान नहीं करता है, और एक संपूर्ण ध्वनि इंटरैक्शन सिस्टम बनाने के लिए इसे अन्य भाषण मॉड्यूल के साथ संयोजित करने की आवश्यकता है। 8kHz टेलीफोन चैनल, मजबूत पृष्ठभूमि शोर (सिग्नल-टू-शोर अनुपात <10dB), बच्चों या बुजुर्ग स्पीकर जैसे लंबी-पूंछ परिदृश्यों में पहचान प्रदर्शन को लक्ष्य डेटा पर वास्तविक माप द्वारा सत्यापित करने की आवश्यकता है। जब GPU ऑफ़लाइन अनुमान का उपयोग नहीं किया जाता है, तो CPU ONNX अनुमान की विलंबता सैकड़ों मिलीसेकंड तक पहुंच सकती है, जो उच्च-समवर्ती वास्तविक समय परिदृश्यों के लिए उपयुक्त नहीं है।

सारांश और आउटलुक

3डी-स्पीकर ने चीनी वॉयसप्रिंट रिकग्निशन ओपन सोर्स समुदाय में "डेटासेट + टूलकिट" एकीकरण का एक अद्वितीय पारिस्थितिक क्षेत्र स्थापित किया है - piannote.audio (जो अनुसंधान-आधारित डायराइजेशन पर केंद्रित है) और वीस्पीकर (जो स्पीकर रिकग्निशन बेसलाइन पर केंद्रित है) के विपरीत, 3डी-स्पीकर का फोकस बड़े पैमाने पर बहु-आयामी डेटा सेट से प्रतिलिपि प्रस्तुत करने योग्य औद्योगिक-ग्रेड बेंचमार्क तक एक पूर्ण लिंक प्रदान करना है। इसके मूल मूल्य को तीन वाक्यों में संक्षेपित किया जा सकता है: चीनी मल्टी-डिवाइस/मल्टी-डिस्टेंस/मल्टी-डायलेक्ट वॉयसप्रिंट डेटा में अंतराल को भरने के लिए 3डी-स्पीकर डेटा सेट का उपयोग करना; कई बेंचमार्क पर ईईआर रिकॉर्ड को लगातार ताज़ा करने के लिए ERes2NetV2 और CAM++ जैसे मॉडल का उपयोग करना; वॉयसप्रिंट पहचान तकनीक के लिए व्यावसायिक सीमा को कम करने के लिए अपाचे 2.0 ओपन सोर्स प्रोटोकॉल का उपयोग करना।

वर्तमान मुख्य सीमाएँ: सबसे पहले, GitHub रिपॉजिटरी में आधिकारिक रिलीज़ और सिमेंटिक संस्करण संख्याएँ नहीं हैं। उपयोगकर्ताओं के लिए संस्करण संख्या के माध्यम से कोड की स्थिरता और परिवर्तन के दायरे का मूल्यांकन करना कठिन है। उत्पादन उपयोगकर्ताओं को विशिष्ट प्रतिबद्धता लॉक करने की आवश्यकता है। दूसरा, पूर्व-प्रशिक्षण मॉडल मुख्य रूप से 16kHz नमूनाकरण दर के साथ चीनी और अंग्रेजी परिदृश्यों पर केंद्रित है, और इसमें 8kHz टेलीफोन भाषण और कम-संसाधन भाषाओं का सीमित कवरेज है। तीसरा, यह एंटी-स्पूफिंग क्षमताएं प्रदान नहीं करता है, और अतिरिक्त लाइवनेस डिटेक्शन समाधानों को वित्तीय-स्तरीय पहचान प्रमाणीकरण परिदृश्यों में एकीकृत किया जाना चाहिए। चौथा, दस्तावेज़ मुख्य रूप से चीनी में हैं (README अंग्रेजी में है), अंतर्राष्ट्रीय समुदाय का निर्माण अभी भी शुरुआती चरण में है, और कुछ अंग्रेजी तकनीकी ब्लॉग और ट्यूटोरियल संसाधन हैं। पांचवां, कोई आधिकारिक डॉकर छवि और सीआई बिल्ड स्थिति पहचान नहीं है, और उपयोगकर्ताओं को संदर्भ स्थिरता की समस्या को स्वयं हल करने की आवश्यकता है।

बाद की विकास दिशा: GitHub गतिविधि (2026-07 तक अभी भी नई प्रतिबद्धताएं हैं) और ICASSP 2025 पेपर स्वीकृति को देखते हुए, 3डी-स्पीकर टीम अभी भी निवेश करना जारी रखे हुए है। ध्यान देने योग्य विकास दिशाओं में शामिल हैं: क्लाइंट-साइड रीजनिंग का और अनुकूलन (टीएफलाइट/कोरएमएल निर्यात का संभावित लॉन्च), स्ट्रीमिंग डायराइजेशन समर्थन (वर्तमान में केवल ऑफ़लाइन क्लस्टरिंग का समर्थन करता है), अधिक कम-संसाधन भाषाओं के लिए बहु-बोली एक्सटेंशन, और मॉडलस्कोप पारिस्थितिकी तंत्र (जैसे ऑटोएमएल स्वचालित पैरामीटर ट्यूनिंग) के साथ गहरा एकीकरण।

खरीद और गोद लेने का जोखिम मूल्यांकन: अपाचे 2.0 ओपन सोर्स प्रोजेक्ट के रूप में, 3डी-स्पीकर में कोई प्राधिकरण जोखिम और विक्रेता लॉक-इन जोखिम नहीं है, और वॉयसप्रिंट पहचान क्षमताओं के लिए प्रवेश स्तर के सत्यापन और प्रोटोटाइप विकास मंच के रूप में उपयुक्त है। एंटरप्राइज़ एकीकरण को "तीन-चरण विधि" अपनानी चाहिए - पहला (2-4 सप्ताह): यह सत्यापित करने के लिए कि ईईआर व्यवसाय सीमा को पूरा करता है या नहीं, लक्ष्य दृश्य डेटा (लक्ष्य माइक्रोफोन, परिवेश शोर नमूना, लक्ष्य स्पीकर आकार) पर पीओसी करने के लिए पूर्व-प्रशिक्षित मॉडल का उपयोग करें; दूसरा (4-8 सप्ताह): यदि पीओसी मानकों को पूरा करता है, तो पृथक वातावरण (गैर-उत्पादन) में ओएनएनएक्स निर्यात और एपीआई पैकेजिंग को पूरा करें, और मौजूदा एएसआर/एनएलपी पाइपलाइन के साथ एकीकृत करें; तीसरा (निरंतर): ग्रेस्केल ऑनलाइन होने के बाद पर्यावरण के उत्पादन की निगरानी करें ईईआर बहाव (जैसे कि नए पंजीकृत उपयोगकर्ताओं या नए परिदृश्यों के कारण वितरण बदलाव), और गिटहब कमिट अपडेट की आवृत्ति पर ध्यान दें - यदि 6 महीने से अधिक समय तक कोई सक्रिय कमिट नहीं है, तो आपको यह मूल्यांकन करने की आवश्यकता है कि क्या वैकल्पिक उपकरण हैं जिन्हें चुनने की आवश्यकता है। अनुपालन-संवेदनशील उद्योगों (वित्त, सुरक्षा) में उपयोग करने से पहले, आपको मॉडलस्कोप प्लेटफ़ॉर्म मॉडल वेट (जो अपाचे 2.0 से भिन्न हो सकता है) के उपयोग की शर्तों और वाणिज्यिक व्युत्पन्न कार्यों के लिए डेटा सेट के CC BY-SA 4.0 समझौते की प्रयोज्यता की पुष्टि करनी चाहिए।

संबंधित उपकरण: ,

संस्करण जानकारी

  • डायराइजेशन बेंचमार्क अपडेट :ऐशेल-4, एलिमीटिंग, एएमआई, वोक्सकॉनवर्स आदि जैसे कई सार्वजनिक डेटासेट पर प्रतिलिपि प्रस्तुत करने योग्य डीईआर बेंचमार्क परिणाम प्रदान करने के लिए स्पीकर लॉग (डायराइजेशन) रेसिपी को अपडेट किया गया। अभी तक कोई आधिकारिक सटीक तारीख नहीं है।
  • ERes2NetV2 रिलीज़ :ERes2NetV2 और ERes2NetV2_w24s4ep4 पूर्व-प्रशिक्षित मॉडल जारी किए गए, जो कम मापदंडों और तेज़ अनुमान के साथ 200k स्पीकर डेटा सेट के आधार पर प्रशिक्षित हैं। अभी तक कोई आधिकारिक सटीक तारीख नहीं है।
  • मल्टी-मॉडल और एसएसएल विस्तार :एसडीपीएन ने स्व-पर्यवेक्षित मॉडल एक्स-वेक्टर प्रशिक्षण व्यंजन, विज़ुअल मॉड्यूल (टॉकनेट) और सिमेंटिक मॉड्यूल (बीईआरटी) प्रशिक्षण व्यंजन जारी किए। अभी तक कोई आधिकारिक सटीक तारीख नहीं है।
  • ONNX रनटाइम और ERes2NetV2 VoxCeleb :ONNX रनटाइम अनुमान रनटाइम जारी किया गया; VoxCeleb डेटासेट के आधार पर ERes2NetV2 मॉडल जारी किया। अभी तक कोई आधिकारिक सटीक तारीख नहीं है।
  • भाषा आईडी और मल्टीमॉडल डायराइजेशन :भाषा पहचान सूत्र प्रकाशित करें जो ध्वनि सूचना को जोड़ता है; मल्टी-मोडल स्पीकर लॉग फॉर्मूला प्रकाशित करें जो ऑडियो और वीडियो छवियों को फ़्यूज़ करता है। अभी तक कोई आधिकारिक सटीक तारीख नहीं है।
  • रेसनेट और रेस2नेट रेसिपी :3D-स्पीकर, VoxCeleb और CN-Celeb डेटा सेट पर ResNet34 और Res2Net के प्रशिक्षण और अनुमान व्यंजनों को जारी करें; बड़े मार्जिन वाली फ़ाइनट्यून रेसिपी जारी करें। अभी तक कोई आधिकारिक सटीक तारीख नहीं है।
  • ERes2Net-बेस पूर्वप्रशिक्षित :200k स्पीकर चीनी मंदारिन डेटासेट पर प्रशिक्षित ERes2Net-बेस पूर्व-प्रशिक्षित मॉडल जारी किया गया। अभी तक कोई आधिकारिक सटीक तारीख नहीं है।
  • कोर मॉडल लॉन्च :CAM++, ERes2Net-Base, और ERes2Net-बड़े प्री-ट्रेनिंग मॉडल जारी किए गए; डायलॉग डिटेक्शन और सिमेंटिक स्पीकर स्विचिंग डिटेक्शन मॉड्यूल जारी किए गए। अभी तक कोई आधिकारिक सटीक तारीख नहीं है।
  • डेटासेट और आरंभिक रिलीज़ :आधिकारिक तौर पर 3D-स्पीकर डेटा सेट और बेसलाइन मॉडल और ERes2Net, CAM++ और RDINO जैसे बेंचमार्क जारी किए गए। अभी तक कोई आधिकारिक सटीक तारीख नहीं है।

उपयोगकर्ता समीक्षाएं

  • समीक्षाएं लोड हो रही हैं...