मज़ा-ASR1.5 मुफ्त

-

फन-एएसआर1.5 अलीबाबा टोंगी टीम द्वारा लॉन्च किया गया एक बड़ा एंड-टू-एंड स्पीच रिकग्निशन मॉडल है। MoE आर्किटेक्चर पर आधारित, एक एकल मॉडल 30 भाषाओं, सात प्रमुख बोली प्रणालियों और 20 से अधिक स्थानीय उच्चारणों का समर्थन करता है, और इसमें अंतर्निहित बुद्धिमान विराम चिह्न भविष्यवाणी और पाठ सामान्यीकरण क्षमताएं हैं।

मज़ा-ASR1.5 उत्पाद इंटरफेस

फन-एएसआर1.5: अलीबाबा टोंगयी एंड-टू-एंड स्पीच रिकग्निशन मॉडल

फन-एएसआर1.5 के मुख्य पैरामीटर और आँकड़े

प्रोजेक्ट विवरण
उत्पाद का नाम फन-एएसआर1.5 (अलीबाबा टोंगी स्पीच रिकग्निशन मॉडल)
उत्पाद प्रकार एंड-टू-एंड वाक् पहचान बड़ा मॉडल
डिलिवरी फॉर्म पायथन लाइब्रेरी/एपीआई/सीएलआई/एमसीपी सर्वर
समर्थित भाषाएँ 30 भाषाएँ (चीनी, अंग्रेजी, जापानी, कोरियाई, फ्रेंच, जर्मन, स्पेनिश, पुर्तगाली, रूसी, अरबी, आदि)
बोली कवरेज सात प्रमुख बोली प्रणालियाँ, शंघाईनीज़, कैंटोनीज़ और सिचुआन बोलियों जैसी 15 उच्च-मांग वाली बोलियों को अनुकूलित करने पर ध्यान केंद्रित करती हैं
वास्तुकला MoE (मिश्रित विशेषज्ञ वास्तुकला)
नवीनतम संस्करण फ़नएएसआर 1.3.19 (2026-07-19)
ओपन सोर्स समझौता एमआईटी (टूलकिट) / मॉडल वज़न अलग समझौते के साथ आते हैं
गिटहब स्टार्स 19.3k
लक्षित उपयोगकर्ता डेवलपर्स, उद्यम, अनुसंधान संस्थान

पैरामीटर व्याख्या: 30 भाषाओं को कवर करने वाले एक एकल मॉडल का मतलब है कि तैनाती के दौरान प्रत्येक भाषा के लिए अलग-अलग मॉडल उदाहरण बनाए रखने की आवश्यकता नहीं है। MoE आर्किटेक्चर यह सुनिश्चित करता है कि संबंधित विशेषज्ञ मॉड्यूल केवल तभी सक्रिय होता है जब एक विशिष्ट भाषा पहचानी जाती है, और तर्क दक्षता उसी पैमाने के घने मॉडल की तुलना में अधिक होती है। बोली त्रुटि दर (सीईआर) पिछले संस्करण की तुलना में 56.2% कम हो गई है, जो व्यावहारिक परिदृश्यों में मैन्युअल प्रूफरीडिंग लागत को काफी कम कर सकती है।

फन-एएसआर1.5 के उपयोगकर्ता और बाजार की पहचान

फन-एएसआर1.5 के पीछे अलीबाबा दामो अकादमी का ओपन सोर्स फनएएसआर प्रोजेक्ट (गिटहब 19.3k स्टार्स) है। यह वर्तमान में चीनी वाक् पहचान समुदाय में सबसे सक्रिय एंड-टू-एंड टूलकिट में से एक है। PyPI के संचयी डाउनलोड में 178 से अधिक सामुदायिक योगदानकर्ताओं के साथ बड़ी संख्या में व्यक्तिगत डेवलपर्स और कॉर्पोरेट उपयोगकर्ता शामिल हैं।

बेंचमार्क परीक्षण में, फन-एएसआर-नैनो (फन-एएसआर 1.5 श्रृंखला का प्रमुख मॉडल) ने चीनी लंबे ऑडियो परीक्षण सेट पर केवल 8.20% की शब्द त्रुटि दर (सीईआर) हासिल की, जो व्हिस्पर-लार्ज-वी3-टर्बो के 21.71% से काफी कम है। अनुमान की गति वास्तविक समय (वीएलएलएम के साथ) 340 गुना तक पहुंच गई, जो व्हिस्पर की तुलना में 26 गुना से अधिक है। SenseVoiceSmall मॉडल सीपीयू पर 17x वास्तविक समय अनुमान प्राप्त कर सकता है और जीपीयू की आवश्यकता के बिना उत्पादन-स्तर थ्रूपुट को पूरा कर सकता है।

इस परियोजना का व्यापक रूप से मीटिंग मिनट्स, बुद्धिमान ग्राहक सेवा, ध्वनि खोज, उपशीर्षक निर्माण और ऑनलाइन शिक्षा जैसे परिदृश्यों में उपयोग किया गया है। एंटरप्राइज़-स्तर के उपयोगकर्ता अलीबाबा क्लाउड बाइलियन प्लेटफ़ॉर्म के माध्यम से सीधे एपीआई को कॉल कर सकते हैं।

मौज-मस्ती के लागत लाभ-एएसआर1.5

फन-एएसआर1.5 एक पूरी तरह से खुला स्रोत परियोजना है, और इसका मुख्य लाभ शून्य लाइसेंस लागत है।

लागत आयाम विवरण
टूलकिट का उपयोग एमआईटी लाइसेंस, पूरी तरह से मुफ़्त और व्यावसायिक उपयोग के लिए उपलब्ध है
मॉडल वजन मॉडल कार्ड अनुबंध के अधीन, जिनमें से अधिकांश व्यावसायिक उपयोग के लिए निःशुल्क हैं
एपीआई कॉल (अलीबाबा क्लाउड बाइलियन) भुगतान-जैसी-जैसी बिलिंग, कृपया अलीबाबा क्लाउड के वास्तविक समय उद्धरण को देखें
निजी तैनाती अपना खुद का सर्वर बनाएं और केवल बुनियादी ढांचे की लागत वहन करें
प्रतिस्पर्धी उत्पाद तुलना (व्हिस्पर एपीआई) स्व-परिनियोजन के तहत अनुमान की गति 26 गुना अधिक है, और उसी थ्रूपुट के तहत हार्डवेयर लागत काफी कम हो जाती है

सी-साइड लागत: मोडा समुदाय के माध्यम से ऑनलाइन अनुभव पूरी तरह से मुफ़्त है, और स्थानीय तैनाती के लिए केवल जीपीयू वाली मशीन की आवश्यकता होती है (सीपीयू सेंसवॉइसस्मॉल मॉडल भी चला सकता है)। व्यापार-अंत लागत: उद्यम अलीबाबा क्लाउड बाइलियन एपीआई के लिए भुगतान के आधार पर भुगतान करना चुन सकते हैं, या डोमेन से बाहर जाने वाले डेटा से बचने के लिए इसे निजी तौर पर तैनात कर सकते हैं। स्व-परिनियोजन मोड में, फन-एएसआर1.5 की अनुमान दक्षता इसे उसी हार्डवेयर पर व्हिस्पर की तुलना में बहुत अधिक संगामिति ले जाने में सक्षम बनाती है।

फन-एएसआर1.5 के मुख्य कार्य

  • बहुभाषा मान्यता: एक एकल मॉडल में चीनी, अंग्रेजी, जापानी, कोरियाई, फ्रेंच, जर्मन, स्पेनिश, पुर्तगाली, रूसी और अरबी सहित 30 भाषाएं शामिल हैं। प्रत्येक भाषा के लिए स्वतंत्र मॉडल तैनात करने की आवश्यकता नहीं है। अंतरराष्ट्रीय सम्मेलनों और बहुभाषी सामग्री उत्पादन परिदृश्यों के लिए उपयुक्त।

  • स्वचालित भाषा स्विचिंग (कोड-स्विचिंग): भाषा टैग पूर्व निर्धारित करने की आवश्यकता नहीं है, एक ही वार्तालाप में बहु-भाषा मिश्रित आवाजों को स्वचालित रूप से पहचानें और संसाधित करें। यह व्यावसायिक बैठकों और प्रौद्योगिकी पॉडकास्ट जैसे परिदृश्यों के लिए बेहद व्यावहारिक है जहां चीनी और अंग्रेजी मिश्रित होती है, जिससे थकाऊ मैनुअल सेगमेंटेशन एनोटेशन समाप्त हो जाता है।

  • बोली और उच्चारण पहचान: सात प्रमुख बोली प्रणालियों और 20 से अधिक स्थानीय उच्चारणों को शामिल करता है, जो शंघाईनीज़, कैंटोनीज़, सिचुआन और होकियेन जैसी 15 उच्च-मांग वाली बोलियों को अनुकूलित करने पर ध्यान केंद्रित करता है। पिछले संस्करण की तुलना में बोली वर्णों की त्रुटि दर में 56.2% की गिरावट आई है, जो मूल बोली वर्णों की बहाली का समर्थन करती है।

  • प्राचीन काव्य पाठ मान्यता: 97% की चरित्र-स्तरीय सटीकता के साथ "द बुक ऑफ सॉन्ग्स", "चू सी", ली बाई और डू फू की कविताएं, सु शि और शिन किजी की सी कविताओं जैसे क्लासिक ग्रंथों को कवर करने वाले एक वास्तविक-व्यक्ति पाठ संग्रह का निर्माण किया गया। चीनी अध्ययन शिक्षा और सांस्कृतिक विरासत के डिजिटल परिदृश्य के लिए इसका अद्वितीय मूल्य है।

  • इंटेलिजेंट पोस्ट-प्रोसेसिंग: प्रासंगिक शब्दार्थ के आधार पर स्वचालित रूप से अल्पविराम, अवधि, प्रश्न चिह्न आदि जैसे विराम चिह्न डालें, और स्वचालित रूप से बोले गए नंबर, दिनांक, मात्रा, फोन कॉल आदि को मानकीकृत लिखित प्रारूपों में परिवर्तित करें। यह सुविधा मीटिंग मिनट्स और कानूनी ट्रांसक्रिप्ट जैसे परिदृश्यों के लिए पोस्ट-प्रोडक्शन मैन्युअल संपादन समय को काफी कम कर सकती है।

फन-एएसआर1.5 मॉडल और संस्करण विकास

फन-एएसआर1.5 एक ओपन सोर्स प्रोजेक्ट है जो लगातार चलता रहता है। नवीनतम मुख्य संस्करण फ़नएएसआर 1.3.19 (2026-07-19 को जारी) है। मूल विकास प्रक्रिया इस प्रकार है:

संस्करण दिनांक मुख्य परिवर्तन
फ़नएएसआर 1.3.19 2026-07-19 रीयल-टाइम वेबसॉकेट लंबे सत्र डायग्नोस्टिक लॉग को PyPI दस्तावेज़ में पैक किया गया
फ़नएएसआर 1.3.18 2026-07-19 सीएलआई उपशीर्षक विभाजन प्रतिगमन को ठीक करें, एसआरटी आउटपुट वाक्यों द्वारा खंडित है
फ़नएएसआर 1.3.17 2026-07-19 SenseVoice llama.cpp रनटाइम सुधार, Windows CUDA समर्थन
फ़नएएसआर 1.3.16 2026-07-18 फन-एएसआर-नैनो रीयल-टाइम वेबसॉकेट सेवा सीधे PyPI से स्थापित की गई है
फ़नएएसआर 1.3.15 2026-07-17 स्ट्रीमिंग विश्वसनीयता में सुधार, फन-एएसआर-नैनो संगतता फिक्स
फ़नएएसआर 1.3.3 2026-05-24 funasr-सर्वर सीएलआई, ओपनएआई संगत एपीआई, एमसीपी सर्वर
फन-एएसआर-नैनो-2512 2025-12-15 पहला फन-एएसआर-नैनो फ्लैगशिप मॉडल जारी

मॉडल वंशावली के संदर्भ में, फनएएसआर टूलकिट कई मॉडल विकल्प प्रदान करता है: फन-एएसआर-नैनो (चीनी/अंग्रेजी/जापानी + बोली), फन-एएसआर-एमएलटी-नैनो (31 भाषाएं), सेंसवॉइसस्मॉल (5 भाषाएं + भावना पहचान), पैराफॉर्मर (कम विलंबता स्ट्रीमिंग एएसआर), क्यूवेन3-एएसआर (52 भाषाएं), आदि। उपयोगकर्ता दृश्य सटीकता, भाषा कवरेज और हार्डवेयर स्थितियों के आधार पर लचीले ढंग से चयन कर सकते हैं।

फन-एएसआर1.5 के तकनीकी लाभ

फन-एएसआर1.5 के मुख्य तकनीकी लाभों को तीन स्तरों से विभाजित किया जा सकता है: वास्तुकला, अनुमान दक्षता और तैनाती लचीलापन:

  • एमओई हाइब्रिड एक्सपर्ट आर्किटेक्चर: मॉडल में कई भाषा-संबंधित विशेषज्ञ उप-नेटवर्क शामिल हैं। जब कोई विशिष्ट भाषा सुनी जाती है, तो केवल संबंधित विशेषज्ञ मॉड्यूल सक्रिय होता है। यह डिज़ाइन 30 भाषाओं को कवर करने वाले एकल मॉडल की पैरामीटर दक्षता को समान पैमाने के सघन मॉडल की तुलना में बहुत अधिक बनाता है। अनुमान के दौरान गणना की मात्रा बहुत कम हो जाती है। साथ ही, प्रत्येक विशेषज्ञ मॉड्यूल को एक दूसरे के साथ हस्तक्षेप किए बिना स्वतंत्र रूप से अनुकूलित किया जा सकता है।

  • श्रेणीबद्ध और चरणबद्ध प्रशिक्षण रणनीति: चरणों और चरणों में प्रशिक्षण के लिए सटीक डेटा का उपयोग करें - पहले सामान्य बहु-भाषा पूर्व-प्रशिक्षण करें, फिर बोली/उच्चारण को ठीक करें, और अंत में विशेष दृश्य (जैसे प्राचीन कविता) संरेखण करें। यह प्रशिक्षण प्रक्रिया मॉडल को एक चरण में प्रशिक्षित मॉडल की तुलना में वास्तविक दुनिया के जटिल भाषण परिदृश्यों में काफी अधिक मजबूत बनाती है।

  • पूर्ण-लिंक परिनियोजन मैट्रिक्स: पायथन लाइब्रेरी ('पिप इंस्टाल फनसर') से ओपनएआई संगत एपीआई सेवा ('फनासर-सर्वर') तक, llama.cpp/GGUF एज-साइड बाइनरी से डॉकर कंटेनरीकृत परिनियोजन तक, एमसीपी सर्वर से वीएलएलएम बैच अनुमान इंजन तक, व्यक्तिगत विकास मशीनों से लेकर बड़े पैमाने पर उत्पादन समूहों तक पूर्ण परिनियोजन आवश्यकताओं को कवर करता है। विशेष रूप से, llama.cpp रनटाइम, Python रनटाइम की आवश्यकता के बिना फ़नएएसआर को शुद्ध सीपीयू और एज डिवाइसों में लाता है, जिससे इसे IoT और एम्बेडेड परिदृश्यों में अद्वितीय लाभ मिलते हैं।

  • अनुमान प्रदर्शन में अग्रणी: फन-एएसआर-नैनो + वीएलएलएम 340x वास्तविक समय (आरटीएफएक्स) तक पहुंचता है, सेंसवॉइसस्मॉल सीपीयू पर 17x वास्तविक समय तक पहुंचता है। व्हिस्पर-लार्ज-वी3 के 13 गुना रियल-टाइम (जीपीयू) की तुलना में, सीपीयू पर फनएएसआर की अनुमान गति जीपीयू पर व्हिस्पर के प्रदर्शन से भी अधिक है, जिससे सीपीयू कार्डलेस तैनाती एक व्यवहार्य समाधान बन जाती है।

फन-एएसआर1.5 कैसे उपयोग करें

फ़न-एएसआर1.5 विभिन्न प्रकार के उपयोग के तरीके प्रदान करता है, और डेवलपर्स परिदृश्य के अनुसार लचीले ढंग से चयन कर सकते हैं:

प्रवेश विवरण
पायथन लाइब्रेरी (पिप) पिप इंस्टाल फनसर, जिसे ऑटोमॉडल एपीआई के माध्यम से बुलाया जाता है
सीएलआई कमांड लाइन funasr Audio.wav लिप्यंतरण है और SRT/JSON आउटपुट का समर्थन करता है
ओपनएआई संगत एपीआई funasr-server --device cuda सेवा शुरू करता है, POST /v1/audio/transscriptions
एमसीपी सर्वर क्लाउड/कर्सर जैसे एआई एजेंटों के लिए वाक् पहचान क्षमताओं को कॉल करने के लिए
मैजिक स्कोप समुदाय ऑनलाइन अनुभव सीधे ब्राउज़र का उपयोग करें, किसी इंस्टॉलेशन की आवश्यकता नहीं: https://modelscope.cn/studios/iic/FunAudio-ASR
llama.cpp बाइनरी शुद्ध सीपीयू/एज रन, किसी पायथन संदर्भ की आवश्यकता नहीं

पायथन के साथ जल्दी से शुरुआत करें:

funasr से ऑटोमॉडल आयात करें

मॉडल = ऑटोमॉडल(मॉडल='फनऑडियोएलएलएम/फन-एएसआर-नैनो-2512', डिवाइस='क्यूडा')
परिणाम = मॉडल.जनरेट (इनपुट = "ऑडियो.wav")
प्रिंट(परिणाम[0]["पाठ"])

सीएलआई एक-पंक्ति प्रतिलेखन:

funasr ऑडियो.wav --आउटपुट-फॉर्मेट json --spk --टाइमस्टैम्प

एपीआई सेवा प्रारंभ करें:

funasr-सर्वर--डिवाइस क्यूडा
# सेवा शुरू होने के बाद, लोकलहोस्ट:8000 पर एक ओपनएआई संगत इंटरफ़ेस प्रदान करें

विशिष्ट उपयोग प्रक्रिया: फ़नएएसआर स्थापित करें → मॉडल लोड करें (स्वचालित रूप से वज़न डाउनलोड करें) → इनपुट ऑडियो फ़ाइलें/स्ट्रीम → संरचित पहचान परिणाम प्राप्त करें → पोस्ट-प्रोसेसिंग (विराम चिह्न/सामान्यीकरण)। पूरी प्रक्रिया में भाषा टैग को मैन्युअल रूप से सेट करने की कोई आवश्यकता नहीं है, मॉडल स्वचालित रूप से इसे पहचान लेता है।

मनोरंजन के लिए उत्पाद मूल्य निर्धारण-एएसआर1.5

फन-एएसआर1.5 की ओपन सोर्स रणनीति इसे महत्वपूर्ण लागत लाभ देती है:

  • सामुदायिक संस्करण (निःशुल्क): PyPI के माध्यम से GitHub रिपॉजिटरी डाउनलोड स्थापित करें, और मैजिक कम्युनिटी का ऑनलाइन अनुभव निःशुल्क करें। एमआईटी ओपन सोर्स लाइसेंस व्यावसायिक उपयोग और माध्यमिक विकास की अनुमति देता है।
  • अलीबाबा क्लाउड बाइलियन एपीआई (पे-एज़-यू-गो): उन उपयोगकर्ताओं के लिए जो अपना स्वयं का बुनियादी ढांचा नहीं बनाना चाहते हैं, वे अलीबाबा क्लाउड बाइलियन प्लेटफ़ॉर्म के माध्यम से एपीआई को कॉल कर सकते हैं और कॉल की मात्रा के आधार पर बिल किया जा सकता है। विशिष्ट कीमत अलीबाबा क्लाउड वास्तविक समय मूल्य निर्धारण पृष्ठ के अधीन है।
  • उद्यम निजीकृत परिनियोजन (स्व-निर्मित): उद्यम अपने स्वयं के सर्वर पर तैनात कर सकते हैं और उन्हें केवल कंप्यूटिंग संसाधनों की लागत वहन करने की आवश्यकता है। फ़नएएसआर की उच्च अनुमान दक्षता का लाभ उठाते हुए, एक एकल जीपीयू बड़ी संख्या में समवर्ती अनुरोधों को संभाल सकता है।

व्यावसायिक वाक् पहचान सेवाओं (जैसे एज़्योर स्पीच, गूगल क्लाउड स्पीच-टू-टेक्स्ट, व्हिस्पर एपीआई) की तुलना में, फन-एएसआर1.5 स्व-परिनियोजन समाधान के टीसीओ (स्वामित्व की कुल लागत) के मध्यम और बड़े पैमाने पर उपयोग परिदृश्यों में महत्वपूर्ण फायदे हैं, और अनुपालन आवश्यकताओं को पूरा करते हुए डेटा डोमेन से बाहर नहीं जाता है।

फन-एएसआर1.5 के अनुप्रयोग परिदृश्य

  • बहु-भाषा सम्मेलन और बहु-भाषा प्रतिलेखन: बहुराष्ट्रीय बैठकों के दौरान वास्तविक समय में बहु-भाषा मिश्रित संवाद सामग्री को सटीक रूप से प्रतिलेखित करें। भाषाओं को पहले से निर्धारित करने की कोई आवश्यकता नहीं है। एक एकल मॉडल 30 भाषाओं को कवर कर सकता है। स्वचालित विराम चिह्न और पाठ सामान्यीकरण पोस्ट-प्रोसेसिंग लागत को काफी कम कर देता है।

  • इंटेलिजेंट ग्राहक सेवा भाषण विश्लेषण: बैच ग्राहक सेवा कॉल रिकॉर्डिंग को संरचित पाठ में ट्रांसक्राइब करता है, बोली पहचान और स्पीकर पृथक्करण का समर्थन करता है, और सेवा गुणवत्ता निगरानी, ​​हॉट इश्यू माइनिंग और भावना विश्लेषण के लिए उपयोग किया जाता है।

  • ऑनलाइन शिक्षा और चीनी अध्ययन का डिजिटलीकरण: प्राचीन कविता पाठ पहचान की 97% चरित्र सटीकता इसे ऑनलाइन चीनी अध्ययन शिक्षा के लिए एक अनूठा उपकरण बनाती है, जो छात्रों के पाठ को वास्तविक समय में पाठ में अनुवाद कर सकती है और तुलना और स्कोरिंग कर सकती है।

  • सामग्री उत्पादन और उपशीर्षक निर्माण: वीडियो निर्माता सीएलआई वन-लाइन कमांड के माध्यम से ऑडियो को एसआरटी उपशीर्षक फ़ाइलों में स्थानांतरित कर सकते हैं। यह स्पीकर टैग और टाइमस्टैम्प का समर्थन करता है, और पॉडकास्ट, पाठ्यक्रम वीडियो और समाचार साक्षात्कार जैसे सामग्री उत्पादन के लिए उपयुक्त है।

  • IoT और एज डिवाइस के बीच वॉयस इंटरेक्शन: llama.cpp/GGUF के माध्यम से चलने पर, फन-एएसआर 1.5 शुद्ध सीपीयू डिवाइस पर चल सकता है और स्मार्ट स्पीकर, कार वॉयस और औद्योगिक नियंत्रण जैसे एज परिदृश्यों के लिए उपयुक्त है।

फन-एएसआर1.5 के लागू समूह

  • एआई एप्लिकेशन डेवलपर्स: जिन डेवलपर्स को वाक् पहचान को अपने एप्लिकेशन में एकीकृत करने की आवश्यकता है, वे इसे पायथन एसडीके, रेस्ट एपीआई या एमसीपी सर्वर के माध्यम से तुरंत एक्सेस कर सकते हैं। pip install funasr प्रारंभ हो सकता है।

  • एंटरप्राइज़ आईटी और डेटा टीम: उन उद्यमों के लिए जिन्हें वाक् पहचान सेवाओं की तैनाती का निजीकरण करने की आवश्यकता है, फ़नएएसआर डोमेन को न छोड़ने वाले डेटा का समर्थन करने के लिए एक पूर्ण तैनाती मैट्रिक्स (डॉकर, कुबेरनेट्स, ओपनएआई संगत एपीआई) प्रदान करता है।

  • अनुसंधान संस्थान और अकादमिक उपयोगकर्ता: ओपन सोर्स मॉडल वेट और एक संपूर्ण प्रशिक्षण और फाइन-ट्यूनिंग टूल श्रृंखला, भाषण पहचान, बोलीविज्ञान, बहुभाषी एएसआर और अन्य दिशाओं में शोध कार्य के लिए उपयुक्त।

  • सामग्री निर्माता और मीडिया कार्मिक: ऐसे रचनाकार जिन्हें ऑडियो/वीडियो को तुरंत पाठ में स्थानांतरित करने और उपशीर्षक उत्पन्न करने की आवश्यकता होती है। सीएलआई कमांड की एक पंक्ति के साथ ट्रांसकोडिंग को पूरा कर सकता है और एसआरटी/जेएसओएन/वीटीटी जैसे प्रारूपों में आउटपुट का समर्थन करता है।

  • भीड़ के लिए उपयुक्त नहीं: अल्ट्रा-लो विलंबता (<100ms एंड-टू-एंड) के लिए सख्त आवश्यकताओं के साथ वास्तविक समय संचार परिदृश्यों के लिए, परीक्षण के बाद मूल्यांकन करने की सिफारिश की जाती है; जिन उपयोगकर्ताओं को शुद्ध क्लाउड-मुक्त संचालन और रखरखाव होस्टिंग सेवाओं की आवश्यकता होती है, उन्हें स्व-परिनियोजन के बजाय अलीबाबा क्लाउड बाइलियन एपीआई को प्राथमिकता देने की सलाह दी जाती है; शुद्ध व्यावसायिक उपयोगकर्ता जो कमांड लाइन या पायथन प्रोग्रामिंग से परिचित नहीं हैं, उन्हें अलीबाबा क्लाउड बाइलियन विज़ुअल इंटरफ़ेस या तृतीय-पक्ष एकीकरण का उपयोग करने की आवश्यकता है।

मज़ा-एएसआर1.5 का सारांश और आउटलुक

फन-एएसआर1.5 वाक् पहचान के क्षेत्र में अलीबाबा टोंगयी टीम की एक महत्वपूर्ण ओपन सोर्स उपलब्धि है। इसकी मुख्य प्रतिस्पर्धात्मकता इसमें निहित है: एकल-मॉडल बहु-भाषा कवरेज (30 भाषाएँ + सात प्रमुख बोलियाँ) बहु-मॉडल परिनियोजन के संचालन और रखरखाव की जटिलता को कम करती है; MoE आर्किटेक्चर द्वारा लाई गई अनुमान दक्षता इसे समान हार्डवेयर पर प्रतिस्पर्धी उत्पादों से कहीं अधिक थ्रूपुट प्राप्त करने में सक्षम बनाती है; पूर्ण-लिंक ओपन सोर्स रणनीति (एमआईटी प्रोटोकॉल + पूर्ण परिनियोजन टूल श्रृंखला) उद्यमों और डेवलपर्स को कम लागत, अत्यधिक नियंत्रणीय वाक् पहचान अवसंरचना प्रदान करती है।

सीमाएँ: हालाँकि मॉडल वज़न का उपयोग मुफ़्त में किया जा सकता है, विभिन्न मॉडलों के लाइसेंस समझौते अलग-अलग होते हैं, और व्यावसायिक उपयोग से पहले विशिष्ट मॉडल कार्ड की प्राधिकरण शर्तों की पुष्टि की जानी चाहिए; अल्ट्रा-लो विलंबता स्ट्रीमिंग परिदृश्य (जैसे वास्तविक समय इंटरकॉम अनुवाद) को अभी भी लक्षित ट्यूनिंग की आवश्यकता होती है; बेहद कम संसाधन वाले एज डिवाइस (एमसीयू स्तर) के लिए, llama.cpp रनटाइम को अभी भी लगातार अनुकूलित किया जा रहा है।

खरीद/गोद लेने का जोखिम मूल्यांकन: अलीबाबा दामो अकादमी द्वारा संचालित एक ओपन सोर्स प्रोजेक्ट के रूप में, फ़नएएसआर को दीर्घकालिक और स्थिर समुदाय और उद्यम समर्थन प्राप्त है, जिसमें 19.3k GitHub सितारे और 178 योगदानकर्ता इसकी पारिस्थितिक गतिविधि साबित करते हैं। अपनाते समय उद्यमों को ध्यान देने की आवश्यकता है: ओपन सोर्स संस्करण एसएलए गारंटी प्रदान नहीं करता है, और प्रमुख उत्पादन उद्यमों को अलीबाबा क्लाउड बाइलियन एपीआई के माध्यम से एंटरप्राइज़-स्तरीय समर्थन प्राप्त करने की अनुशंसा की जाती है; व्यावसायिक उपयोग से पहले मॉडल वज़न के लिए स्वतंत्र लाइसेंस समझौतों की एक-एक करके पुष्टि की जानी चाहिए; प्रोजेक्ट पुनरावृत्ति लय तेज़ है (हर महीने कई छोटे संस्करण जारी किए जाते हैं), और उत्पादन उद्यमों को संस्करण को लॉक करना चाहिए और प्रतिगमन परीक्षण करना चाहिए। कुल मिलाकर, फन-एएसआर1.5 वर्तमान में स्व-निर्माण क्षमताओं और डेटा अनुपालन आवश्यकताओं वाली टीमों के लिए चीनी भाषण पहचान के क्षेत्र में सबसे अधिक लागत प्रभावी ओपन सोर्स विकल्पों में से एक है।

संबंधित उपकरण: , udio

संस्करण जानकारी

  • फ़नएएसआर 1.3.19 :वास्तविक समय वेबसॉकेट लंबे सत्र निदान फ़ंक्शन को जोड़ा गया, बेहतर सीएलआई उपशीर्षक पीढ़ी और विराम चिह्न लोडिंग, और अद्यतन सामुदायिक दस्तावेज़ीकरण।
  • फ़नएएसआर 1.3.18 :एसआरटी उपशीर्षक विभाजन प्रतिगमन समस्या को ठीक किया गया, समर्थित वाक्य-स्तरीय टाइमस्टैम्प अनुरोध और बेहतर विराम चिह्न मॉडल लोडिंग।
  • फ़नएएसआर 1.3.17 :वास्तविक समय WebSocket सत्र डायग्नोस्टिक लॉग, SenseVoice llama.cpp रनटाइम सुधार, Windows CUDA समर्थन जोड़ा गया।
  • फ़नएएसआर 1.3.16 :फन-एएसआर-नैनो रीयल-टाइम वेबसॉकेट सेवा सीधे PyPI से इंस्टॉल की जा सकती है और क्लाइंट-संचालित एंडपॉइंट मोड का समर्थन करती है।
  • फ़नएएसआर v1.3.15 :स्ट्रीमिंग विश्वसनीयता में सुधार करें, फ़न-एएसआर-नैनो संगतता समस्याओं को ठीक करें, और सीएलआई और टेक्स्ट प्रोसेसिंग में सुधार करें।

उपयोगकर्ता समीक्षाएं

  • समीक्षाएं लोड हो रही हैं...