अलीबाबा ने क्वेन-ऑडियो-3.0-एएसआर-फ्लैश जारी किया: लंबी ऑडियो स्थिरता, हॉट वर्ड अनुकूलन और संरचित आउटपुट
अलीबाबा ने क्वेन-ऑडियो-3.0-एएसआर-फ्लैश स्पीच रिकग्निशन मॉडल जारी किया, जो लंबे ऑडियो संदर्भ स्थिरता, पेशेवर उद्योग शब्द पहचान और हॉट शब्द अनुकूलन में सुधार करता है, और वॉयस पॉलिशिंग और संरचित टेक्स्ट आउटपुट क्षमताओं को जोड़ता है।
अलीबाबा के ओपन सोर्स स्पीच रिकग्निशन (एएसआर) कैंप में एक नया सदस्य जोड़ा गया है - क्वेन-ऑडियो-3.0-एएसआर-फ्लैश, जो उच्च-थ्रूपुट, कम-विलंबता भाषण ट्रांसक्रिप्शन परिदृश्यों के लिए डिज़ाइन किया गया है। पारंपरिक "टेक्स्ट में कनवर्ट करें" पुनरावृत्ति की तुलना में, यह अपग्रेड स्पष्ट रूप से वास्तविक कार्यान्वयन के करीब है: लंबी ऑडियो स्थिरता, पेशेवर उद्योग शब्द पहचान, हॉट शब्द अनुकूलन, वॉयस पॉलिशिंग और संरचित आउटपुट एक साथ किया जाता है।
सीधे चीनी भाषण प्रतिलेखन के तीन समस्या बिंदुओं पर पहुँचें
लंबे ऑडियो संदर्भ संगति लंबे भाषण और लंबे संवाद परिदृश्यों में "असंगतता और सामग्री बहाव" की सामान्य समस्याओं को लक्षित करता है; हॉट वर्ड कस्टमाइज़ेशन उपयोगकर्ताओं को सटीकता में सुधार करने के लिए पहचान प्रक्रिया में विशिष्ट नाम, ब्रांड और उद्योग के शब्दों को शामिल करने की अनुमति देता है। ये दो आरोपित व्यावसायिक उद्योग शब्द पहचानें उच्च-आवृत्ति चीनी परिदृश्यों जैसे मीटिंग मिनट्स और ग्राहक सेवा गुणवत्ता निरीक्षण के लिए लगभग तैयार की गई हैं - यह चीनी भाषण पहचान का सबसे कठिन और मूल्यवान हिस्सा भी है।
"कन्वर्ट टेक्स्ट" से "एजेंट द्वारा व्यवस्थित किया जा सकता है"
वॉयस पॉलिशिंग और संरचित टेक्स्ट आउटपुट अधिक उल्लेखनीय हैं। पूर्व लिखित पाठ की पठनीयता को अनुकूलित करता है, जबकि बाद वाला सीधे संरचित डेटा को आउटपुट करता है ताकि डाउनस्ट्रीम सिस्टम (बैठक मिनट, ग्राहक सेवा गुणवत्ता निरीक्षण, उपशीर्षक पीढ़ी) को माध्यमिक सफाई के बिना उपभोग किया जा सके। इसका मतलब यह है कि एएसआर एक "टूल-आधारित क्षमता" से एक "घटक जिसे एजेंटों द्वारा सीधे व्यवस्थित किया जा सकता है" में बदल रहा है, और इसका पारिस्थितिक मूल्य बिल्कुल भी समान स्तर पर नहीं है।
फ़्लैश फ़ाइल के रूप में, मॉडल कम विलंबता और उच्च थ्रूपुट पर केंद्रित है। यह लाइव उपशीर्षक और वॉयस ग्राहक सेवा जैसे वास्तविक समय परिदृश्यों में बड़े पैमाने पर तैनाती के लिए उपयुक्त है, और फ्लैगशिप फ़ाइल के साथ एक ग्रेडिएंट कवरेज बनाता है। यह
भविष्य में ट्रैकिंग के लायक कई दिशाएँ:
- लंबा ऑडियो और हॉट शब्द वास्तविक माप: वास्तविक परिदृश्यों में सटीकता मूल्यांकन प्रेस कॉन्फ्रेंस डेटा की तुलना में अधिक विश्वसनीय है।
- फ्लैश गियर विलंब प्रदर्शन: वास्तविक समय परिदृश्यों का अंत-से-अंत विलंब परिनियोजन सीमा निर्धारित करता है।
- क्वेन के साथ पूर्ण-मोडल सहयोग: भाषण और दृष्टि एकीकृत मॉडल के एकीकरण की प्रगति।
समीक्षाएं