व्हिस्पर लार्ज-वी3: ओपन सोर्स स्पीच रिकग्निशन का "सीलिंग" संस्करण, 99+ भाषा ट्रांसक्रिप्शन का संचय और 680,000 घंटे का कमजोर पर्यवेक्षित प्रशिक्षण

व्हिस्पर लार्ज-वी3 वर्तमान में सबसे बड़ा सार्वजनिक व्हिस्पर मॉडल संस्करण है, जो बहु-भाषा प्रतिलेखन और अनुवाद गुणवत्ता में पिछले उच्चतम स्तर तक पहुंच गया है, और 2022 में कमजोर पर्यवेक्षित प्रशिक्षण के 680,000 घंटे के पुनरावृत्त संचय को विरासत में मिला है।

व्हिस्पर लार्ज-वी3: ओपन सोर्स स्पीच रिकग्निशन का "सीलिंग" संस्करण, 99+ भाषा ट्रांसक्रिप्शन का संचय और 680,000 घंटे का कमजोर पर्यवेक्षित प्रशिक्षण

व्हिस्पर लार्ज-वी3 वर्तमान में सबसे बड़ा सार्वजनिक व्हिस्पर मॉडल संस्करण है। यह 2023 के अंत में जारी किया जाएगा और बहु-भाषा प्रतिलेखन और अनुवाद गुणवत्ता के मामले में श्रृंखला में उच्चतम स्तर पर पहुंच जाएगा। एमआईटी लाइसेंस के तहत ओपनएआई द्वारा ओपन सोर्स किए गए एक सामान्य वाक् पहचान मॉडल के रूप में, यह सितंबर 2022 में प्रारंभिक संस्करण के तकनीकी मार्ग को जारी रखता है (680,000 घंटे का बहु-भाषा कमजोर पर्यवेक्षित डेटा, 99+ भाषाओं को कवर करता है), और आवाज अनुप्रयोगों के निर्माण के लिए एक बेंचमार्क ओपन सोर्स एएसआर समाधान है।

  • सबसे बड़ा सार्वजनिक संस्करण: लार्ज-वी3 व्हिस्पर श्रृंखला का सबसे बड़ा सार्वजनिक मॉडल है, जिसमें प्रतिलेखन और अनुवाद की गुणवत्ता अब तक के उच्चतम स्तर पर पहुंच गई है।
  • बहुभाषी कवरेज: 99+ भाषाओं में लिप्यंतरण, अनुवाद और टाइमस्टैम्प संरेखण का समर्थन करता है।
  • एमआईटी लाइसेंस: व्यावसायिक उपयोग और स्थानीय परिनियोजन के लिए निःशुल्क, यह ओपन सोर्स वाक् पहचान के लिए वास्तविक मानकों में से एक है।
  • एकाधिक पैमाने उपलब्ध: छोटे से बड़े तक पांच पैमाने, किनारे वाले उपकरणों से लेकर उच्च-परिशुद्धता परिदृश्यों तक की जरूरतों को कवर करते हैं।

संस्करण पृष्ठभूमि

व्हिस्पर ओपनएआई का ओपन सोर्स जनरल स्पीच रिकग्निशन मॉडल है, जो बड़े पैमाने पर कमजोर पर्यवेक्षित प्रशिक्षण प्रतिमान को अपनाता है: प्रारंभिक संस्करण को 680,000 घंटे के बहुभाषी डेटा के आधार पर प्रशिक्षित किया जाता है और यह मैन्युअल एनोटेशन पर निर्भर नहीं होता है, जिससे व्यापक भाषा कवरेज प्राप्त होता है। इसका संस्करण विकास एक स्पष्ट पुनरावृत्ति पथ को दर्शाता है: बड़ा (2022-09-21) प्रारंभिक रिलीज़ है; लार्ज-वी2 (2022-12) बहु-भाषा प्रदर्शन में सुधार करता है और त्रुटि दर को कम करता है; लार्ज-वी3 (2023-11) सबसे बड़ा सार्वजनिक संस्करण बन गया है, जो बहु-भाषा प्रतिलेखन और अनुवाद में श्रृंखला में उच्चतम स्तर पर पहुंच गया है।

इस संस्करण की मुख्य विशेषताएं

पहचान गुणवत्ता में सुधार

  • बहु-भाषा प्रतिलेखन: लार्ज-वी3 ने पिछली पीढ़ी की तुलना में बहु-भाषा भाषण प्रतिलेखन में काफी सुधार किया है, और कमजोर भाषा परिदृश्यों में त्रुटि दर में काफी कमी आई है।
  • अनुवाद क्षमता: क्रॉस-भाषा सामग्री प्रसंस्करण परिदृश्यों की सेवा के लिए गैर-अंग्रेजी भाषण का अंग्रेजी में अनुवाद करने का समर्थन करता है।
  • टाइम स्टैम्प संरेखण: उपशीर्षक निर्माण और ऑडियो और वीडियो संरेखण अनुप्रयोगों का समर्थन करने के लिए शब्द-दर-शब्द टाइमस्टैम्प प्रदान करता है।

इंजीनियरिंग पारिस्थितिकी

  • मल्टी-स्केल परिनियोजन: छोटे/बेस/छोटे/मध्यम/बड़े ग्रेडिएंट, किनारे से उच्च-परिशुद्धता वाले क्लाउड तक की मांग पर चयन करें।
  • सामुदायिक त्वरित कार्यान्वयन: व्हिस्पर.सीपीपी और फास्टर-व्हिस्पर जैसे सामुदायिक कार्यान्वयन अनुमान दक्षता में काफी सुधार करते हैं और सीपीयू और उपभोक्ता-ग्रेड जीपीयू संचालन का समर्थन करते हैं।
  • स्थानीय परिनियोजन: इसे एमआईटी लाइसेंस के तहत स्वतंत्र रूप से स्व-होस्ट किया जा सकता है, और डेटा को देश छोड़े बिना ट्रांसक्राइब किया जा सकता है।

डेवलपर्स के लिए अर्थ

उद्योग के दृष्टिकोण से, व्हिस्पर लार्ज-वी3 का मूल्य "उच्च गुणवत्ता वाली वाक् पहचान" को स्वतंत्र रूप से उपलब्ध बुनियादी ढांचे में बदलने में निहित है। घरेलू डेवलपर्स के लिए, इसका मतलब है कि वे वाणिज्यिक एपीआई पर भरोसा किए बिना अपने स्वयं के डेटा पाइपलाइनों में भाषण प्रतिलेखन, मीटिंग मिनट्स, उपशीर्षक पीढ़ी और बहु-भाषा सामग्री प्रसंस्करण को पूरा कर सकते हैं। वाणिज्यिक पहचान सेवाओं की तुलना में, स्व-होस्टेड व्हिस्पर का मुख्य व्यापार "नियंत्रणीय लागत + डेटा गोपनीयता" बनाम "ट्यूनिंग सेवाएं और अल्ट्रा-लो विलंबता" है।

वॉयस क्षमता स्टैक में, व्हिस्पर "समझने" लिंक के लिए ज़िम्मेदार है, और के वॉयस इंटरफ़ेस को पूरक करता है - पूर्व को स्वयं-होस्ट किया जा सकता है, और बाद वाले को बॉक्स से बाहर उपयोग किया जा सकता है। जब "बोलने" और "बातचीत" क्षमताओं की आवश्यकता होती है, तो टीटीएस और वॉयस एजेंट उत्पादों को एक संपूर्ण लिंक बनाने के लिए संयोजित करने की आवश्यकता होती है।

आरंभ करने के लिए युक्तियाँ

  • त्वरित सत्यापन: एक मध्यम/बड़े मॉडल से प्रारंभ करें और लक्ष्य भाषा सेट की पहचान सटीकता का मूल्यांकन करें।
  • उत्पादन परिनियोजन: अनुमान को अनुकूलित करने के लिए तेज़-व्हिस्पर या व्हिस्पर.सीपीपी का उपयोग करें, और लंबे ऑडियो को संसाधित करने के लिए वीएडी के साथ काम करें।
  • उपशीर्षक/मिनट दृश्य: सीधे उपशीर्षक उत्पन्न करने या टाइमलाइन के साथ मीटिंग रिकॉर्ड बनाने के लिए टाइमस्टैम्प संरेखण क्षमता का उपयोग करें।

भविष्य में ध्यान देने योग्य दिशाएँ

  1. सामुदायिक त्वरण समाधानों की परिपक्वता: व्हिस्पर.सीपीपी और तेज़-व्हिस्पर के बीच अनुमान दक्षता और सटीकता के बीच व्यापार-बंद।
  2. चीनी और बोली अनुकूलन: चीनी उच्चारण, उच्चारण और बोली परिदृश्यों में मापा प्रदर्शन और बढ़िया ट्यूनिंग अभ्यास।
  3. वाणिज्यिक एएसआर के साथ प्रतिस्पर्धा और सहयोग: स्व-होस्ट किए गए समाधानों और वाणिज्यिक सेवाओं के बीच की सीमा, और परिदृश्यों के अनुसार उन्हें सर्वोत्तम तरीके से कैसे संयोजित किया जाए।
कॉपीराइट: सामग्री स्रोत ओपनएआई आधिकारिक रिलीज । इस प्लेटफॉर्म ने सूचना प्रसार और सीखने के आदान-प्रदान के उद्देश्य से इस सामग्री को संकलित और व्यवस्थित किया है। कॉपीराइट संबंधी चिंताओं के लिए कृपया हमसे संपर्क करें।

समीक्षाएं

  • समीक्षाएं लोड हो रही हैं...