फ़नएएसआर
मुफ्त
फ़नएएसआर अलीबाबा टोंगी लैब का एक ओपन सोर्स औद्योगिक-ग्रेड स्पीच रिकग्निशन टूलकिट है। यह एएसआर, वीएडी, विराम चिह्न पुनर्प्राप्ति, स्पीकर पृथक्करण, भावना पहचान और ऑडियो इवेंट पहचान को एकीकृत करता है। यह एक एकीकृत पायथन इंटरफ़ेस और ओपनएआई संगत एपीआई प्रदान करता है, 50+ भाषाओं में 340x वास्तविक समय दर अनुमान का समर्थन करता है, और तैनाती के लिए इसे पूरी तरह से निजीकृत किया जा सकता है।
FunASR: अलीबाबा टोंगी लैब का ओपन सोर्स इंडस्ट्रियल-ग्रेड स्पीच रिकग्निशन टूलकिट
फ़नएएसआर के मुख्य पैरामीटर और आँकड़े
| प्रोजेक्ट | विवरण |
|---|---|
| उत्पाद का नाम | फनएएसआर (फन ऑडियो स्पीच रिकॉग्निशन) |
| उत्पाद प्रकार | ओपन सोर्स स्पीच रिकग्निशन टूलकिट |
| डिलिवरी फॉर्म | पायथन एसडीके / सीएलआई / ओपनएआई संगत एपीआई सर्वर / डॉकर / llama.cpp एज परिनियोजन |
| समर्थित भाषाएँ | 50+ भाषाएँ (फन-एएसआर-नैनो चीनी/अंग्रेजी/जापानी और चीनी बोलियों का समर्थन करता है; एमएलटी-नैनो 31 भाषाओं का समर्थन करता है; क्यूवेन3-एएसआर 52 भाषाओं का समर्थन करता है) |
| मॉडल का आकार | 0.4M (fsmn-vad) ~ 1.7B (Qwen3-ASR) |
| गिटहब स्टार्स | 19.3k |
| ओपन सोर्स समझौता | एमआईटी (टूलकिट); मॉडल वज़न को संबंधित समझौतों के अनुसार लाइसेंस दिया जाता है |
| लक्षित उपयोगकर्ता | डेवलपर्स, एंटरप्राइज एआई टीमें, वॉयस उत्पाद इंटीग्रेटर्स |
फ़नएएसआर एक एकल SaaS उत्पाद नहीं है, बल्कि एक पूर्ण ओपन सोर्स वाक् समझ उपकरण श्रृंखला है। यह कच्चे ऑडियो से संरचित पाठ तक एक "एंड-टू-एंड पाइपलाइन" प्रदान करता है - वीएडी सेगमेंटेशन एएसआर मान्यता, विराम चिह्न पुनर्प्राप्ति, स्पीकर पृथक्करण, भावना पहचान, ऑडियो ईवेंट पहचान - सभी 'ऑटोमॉडल' एपीआई कॉल की एक पंक्ति के माध्यम से। डेवलपर्स तीसरे पक्ष की एपीआई सेवाओं को ऑडियो डेटा भेजे बिना स्थानीय रूप से, इंट्रानेट या क्लाउड में स्वतंत्र रूप से तैनात कर सकते हैं।
मुख्य मात्रात्मक संकेतक: फन-एएसआर-नैनो + वीएलएलएम अनुमान 340x वास्तविक समय दर (आरटीएफ) तक पहुंच सकता है, सेंसवॉइसस्मॉल सीपीयू पर 17x वास्तविक समय दर तक पहुंच सकता है, और सीईआर 7.81% -8.20% जितना कम है, जो व्हिस्पर-लार्ज-वी 3 के 20% सीईआर और 13x वास्तविक समय दर से बेहतर हैं।
फ़नएएसआर के उपयोगकर्ता और बाज़ार की पहचान
- GitHub 19.3k स्टार्स, 178 योगदानकर्ता, 25 आधिकारिक रिलीज़, GitHub पर सबसे सक्रिय ओपन सोर्स ASR टूलकिट में से एक है।
- PyPI मासिक डाउनलोड लगातार बढ़ रहा है, और
funasrपैकेज Python ASR पारिस्थितिकी तंत्र की मुख्य निर्भरताओं में से एक बन गया है। - एंटरप्राइज़ एडॉप्शन: RAGFlow, Dify, LangChain, और AutoGen जैसे मुख्यधारा AI फ्रेमवर्क द्वारा वॉयस इनपुट मॉड्यूल के रूप में एकीकृत; समुदाय ने 30 से अधिक एकीकरण परियोजनाएं जमा की हैं।
- उद्योग बेंचमार्किंग: चीनी एएसआर परिदृश्य में, फ़नएएसआर की सीईआर और वास्तविक समय दर व्हिस्पर श्रृंखला से काफी आगे है (चीनी शब्द त्रुटि दर लगभग 60% कम है, और सीपीयू अनुमान गति 10-20 गुना अधिक है), और यह स्पीकर पृथक्करण, भावना का पता लगाने और अन्य क्षमताओं का समर्थन करता है जो व्हिस्पर के पास नहीं है।
फ़नएएसआर के लागत लाभ
| लागत आयाम | विवरण |
|---|---|
| खुला स्रोत और मुफ़्त | कोर टूलकिट एमआईटी लाइसेंस, कोई लाइसेंस शुल्क नहीं, कोई एपीआई कॉल शुल्क नहीं |
| निजी तैनाती | इंट्रानेट/एकल मशीन पर पूरी तरह ऑफ़लाइन चलाया जा सकता है, जिसमें डेटा लीक का कोई जोखिम नहीं है और भुगतान करते समय बिलिंग पर कोई दबाव नहीं है |
| हार्डवेयर सीमा | SenseVoiceSmall GPU के बिना CPU पर 17x वास्तविक समय दर प्राप्त कर सकता है; फ़न-एएसआर-नैनो 8GB+ GPU की अनुशंसा करता है |
| व्हिस्पर एपीआई की तुलना करें | क्लाउड एएसआर सेवा लगभग $0.006/मिनट है; फ़नएएसआर स्व-निर्माण लागत केवल हार्डवेयर मूल्यह्रास और बिजली है, जो उच्च-आवृत्ति परिदृश्यों में 90%+ बचा सकती है |
तुलनात्मक विश्लेषण: मध्य-से-उच्च-आवृत्ति परिदृश्य के लिए जो प्रति दिन 1,000 घंटे ऑडियो संसाधित करता है, क्लाउड एएसआर का उपयोग करने के लिए मासिक शुल्क लगभग $10,800+ है, जबकि फ़नएएसआर की स्व-निर्मित तैनाती के लिए केवल एक बार के हार्डवेयर निवेश की आवश्यकता होती है (जीपीयू वाले सर्वर की लागत लगभग $3,000-$8,000 है), और बाद की सीमांत लागत शून्य के करीब है। गोपनीयता-संवेदनशील परिदृश्यों (चिकित्सा, वित्तीय, कानूनी) के लिए, निजीकृत तैनाती के मूल्य को कीमत से नहीं मापा जा सकता है।
फ़नएएसआर के मुख्य कार्य
- मल्टी-मॉडल एएसआर मान्यता: फन-एएसआर-नैनो (चीनी/अंग्रेजी/जापानी + बोली), सेंसवॉइसस्मॉल (5 भाषाएं + भावनाएं + घटनाएं), पैराफॉर्मर (स्ट्रीमिंग/ऑफ़लाइन), क्यूवेन3-एएसआर (52 भाषाएं), व्हिस्पर, आदि को एकीकृत करें, और एक ही एपीआई के साथ मॉडल स्विच करें।
- वॉयस एक्टिविटी डिटेक्शन (VAD): मिलीसेकंड-स्तर fsmn-vad, अनुकूली मौन सीमा, लंबे ऑडियो का स्वचालित विभाजन।
- विराम चिह्न पुनर्प्राप्ति और उलटा पाठ नियमितीकरण:
सीटी-पंकमॉडल स्वचालित रूप से विराम चिह्न जोड़ता है और विहित पाठ को आउटपुट करता है जिसे सीधे पढ़ा जा सकता है। - स्पीकर डायराइजेशन: सीएएम++ मॉडल स्वचालित रूप से "किसने किस समय क्या कहा" की व्याख्या करता है और बहु-व्यक्ति बैठकों का समर्थन करता है।
- भावना पहचान और ऑडियो इवेंट पहचान: SenseVoice में अंतर्निहित भावना पहचान (खुशी/दुख/गुस्सा/तटस्थ) और घटना पहचान (तालियां/हंसी/संगीत/रोना) है।
- OpenAI संगत एपीआई सेवा: एक-पंक्ति कमांड
funasr-serverरेस्टफुल सेवा शुरू करता है। SDK OpenAI ऑडियो एपीआई के साथ संगत है और सीधे LangChain/Dify/AutoGen से जुड़ता है। - एआई एजेंटों के लिए एमसीपी सर्वर: क्लाउड/कर्सर जैसे एजेंट सीधे स्थानीय एएसआर क्षमताओं को कॉल कर सकते हैं।
- एज परिनियोजन (llama.cpp/GGUF): किसी पायथन संदर्भ की आवश्यकता नहीं है, सीपीयू/एज डिवाइस पर एकल बाइनरी चलता है, विंडोज CUDA का समर्थन करता है।
फ़नएएसआर मॉडल और संस्करण विकास
फ़नएएसआर परियोजना 2022 में शुरू हुई और मूल रूप से अलीबाबा दामो अकादमी द्वारा एंड-टू-एंड स्पीच रिकग्निशन टूलकिट (इंटरस्पीच 2023 पेपर) के रूप में जारी की गई थी। 2025-2026 तीव्र पुनरावृत्ति अवधि में प्रवेश करेगा:
| संस्करण | दिनांक | मुख्य परिवर्तन |
|---|---|---|
| v1.3.19 | 2026-07-19 | WebSocket लंबा सत्र समस्या निवारण दस्तावेज़ीकरण; सीएलआई एसआरटी खंडित उपशीर्षक सुधार |
| v1.3.16 | 2026-07-18 | ग्राहक-संचालित वास्तविक समय समापन बिंदु; llama.cpp विंडोज़ CUDA पैकेज |
| v1.3.12 | 2026-06-21 | Qwen3-ASR / GLM-ASR फिक्स |
| v1.3.3 | 2026-05-24 | funasr-सर्वर सीएलआई, ओपनएआई एपीआई, एमसीपी सर्वर, डायनेमिक वीएडी |
| v1.3.0 | 2026-05-20 | Qwen3-ASR (52 भाषाएँ), GLM-ASR-नैनो (17 भाषाएँ) समर्थित |
| v1.2.x | 2025-2026 | फन-एएसआर-नैनो, वीएलएलएम अनुमान इंजन llama.cpp एज रनटाइम |
| v1.0 | 2024 | पहला स्थिर संस्करण, पैराफॉर्मर/सेंसवॉइस एकीकरण |
| v0.x | 2022-2023 | प्रारंभिक संस्करण, बुनियादी एएसआर और प्रशिक्षण ढांचा |
फ़नएएसआर के तकनीकी लाभ
एकल मॉडल के बजाय टूलकिट: व्हिस्पर जैसे एकल-मॉडल समाधानों के विपरीत, फ़नएएसआर एक "मॉडल सुपरमार्केट" है - प्रत्येक उप-कार्य (वीएडी, एएसआर, विराम चिह्न, स्पीकर पृथक्करण, भावना) के लिए एक समर्पित मॉडल है और इसे स्वतंत्र रूप से जोड़ा जा सकता है। उदाहरण के लिए, उत्पादन पाइपलाइन SenseVoice + fsmn-vad + ct-punc + cam++ एक कॉल में सभी प्रोसेसिंग पूरी करती है।
अनुमान दक्षता दमन:
- फन-एएसआर-नैनो + वीएलएलएम: 340x वास्तविक समय दर (व्हिस्पर-लार्ज-वी3 से 26x तेज), सीईआर 8.20%
- SenseVoiceSmall: सीपीयू पर 17x वास्तविक समय (जीपीयू पर व्हिस्पर से तेज), सीईआर 7.81%
- नॉन-ऑटोरेग्रेसिव आर्किटेक्चर (पैराफॉर्मर): स्ट्रीमिंग परिदृश्यों में पहले शब्द की बेहद कम देरी, वेबसॉकेट वास्तविक समय पहचान का समर्थन करता है
परिनियोजन लचीलापन: "पिप इंस्टाल" से लेकर डॉकर/कुबेरनेट्स कंटेनरीकरण से लेकर llama.cpp सिंगल बाइनरी सीपीयू/एज परिनियोजन तक पूरे स्पेक्ट्रम को कवर करता है। funasr-server OpenAI संगत एपीआई प्रदान करता है। मौजूदा एसडीके वाले एप्लिकेशन को स्विच करने के लिए केवल base_url को बदलने की आवश्यकता है।
एजेंट नेटिव सपोर्ट: बिल्ट-इन एमसीपी सर्वर और ओपनएआई एपीआई, एआई एजेंट फ्रेमवर्क जैसे क्लाउड डेस्कटॉप, कर्सर, लैंगचेन, डिफी, ऑटोजेन आदि आवाज-संचालित स्वचालित वर्कफ़्लो का एहसास करने के लिए आवाज क्षमताओं को सीधे एकीकृत कर सकते हैं।
फ़नएएसआर का उपयोग कैसे करें
| प्रवेश | विवरण |
|---|---|
| पायथन एसडीके | पिप इंस्टाल फनसर, ऑटोमॉडल एक लाइन कॉल |
| सीएलआई | funasr Audio.wav डायरेक्ट ट्रांस्क्रिप्शन, JSON/SRT/TSV आउटपुट को सपोर्ट करता है |
| एपीआई सर्वर | funasr-server --device cuda OpenAI संगत समापन बिंदु प्रारंभ करता है |
| डोकर | ऑफ़लाइन/स्ट्रीमिंग डॉकर छवि, एक-पंक्ति स्टार्टअप |
| लामा.सीपीपी | एकल बाइनरी सीपीयू/एज परिनियोजन, कोई पायथन रनटाइम आवश्यक नहीं |
पायथन त्वरित प्रारंभ:
funasr से ऑटोमॉडल आयात करें
मॉडल = ऑटोमॉडल(मॉडल='सेंसवॉइस', vad_model='fsmn-vad',
punc_model='ct-punc', spk_model='cam++', डिवाइस='cuda''
परिणाम = मॉडल.जेनरेट(इनपुट='मीटिंग.वेव', बैच_साइज_एस=300)
परिणाम में एसईजी के लिए[0]["sentence_info"]:
print(f"[{seg['start']/1000:.1f}s] स्पीकर {seg['spk']}: {seg['text']}")
एपीआई सेवा प्रारंभ करें:
पिप इंस्टॉल फनएसआर वीएलएम फास्टापी यूविकॉर्न पायथन-मल्टीपार्ट
funasr-सर्वर--डिवाइस क्यूडा--पोर्ट 8899
# कॉल करें
कर्ल -एक्स पोस्ट http://localhost:8899/v1/audio/transscriptions \
-F "[email protected]" -F "model=fun-asr-nano" -F "response_format=verbose_json"
एमसीपी माउंट (क्लाउड डेस्कटॉप):
{
"एमसीपीसर्वर": {
"फनस्र": {
"कमांड": "फनस्र-सर्वर",
"आर्ग्स": ["--एमसीपी", "--पोर्ट", "8899"]
}
}
}
फ़नएएसआर के लिए उत्पाद मूल्य निर्धारण
फ़नएएसआर कोर टूलकिट एमआईटी ओपन सोर्स लाइसेंस को अपनाता है और पूरी तरह से मुफ़्त है, इसमें कोई छिपा हुआ शुल्क नहीं है, कॉल की संख्या पर कोई सीमा नहीं है, और कोई कार्यात्मक दुर्बलता नहीं है। उद्यम लाइसेंस शुल्क का भुगतान किए बिना स्रोत कोड के आधार पर माध्यमिक विकास और वाणिज्यिक एकीकरण कर सकते हैं।
मॉडल भार एक स्वतंत्र लाइसेंसिंग समझौते को अपनाते हैं। अधिकांश मॉडल (SenseVoice, Paraformer, fsmn-vad, ct-punc, cam++, emotional2vec) का व्यावसायिक रूप से निःशुल्क उपयोग किया जा सकता है। विवरण प्रत्येक मॉडल कार्ड के लाइसेंस के अधीन हैं।
छिपी हुई लागत का आकलन:
- जीपीयू सर्वर हार्डवेयर लागत (फन-एएसआर-नैनो के लिए 8 जीबी + वीआरएएम अनुशंसित; सीपीयू के लिए सेंसवॉइसस्मॉल उपलब्ध)
- संचालन और रखरखाव लागत (डॉकर/K8s परिनियोजन और रखरखाव)
- यदि आप वीएलएलएम त्वरण का उपयोग करते हैं, तो आपको अतिरिक्त वीएलएलएम निर्भरताएं स्थापित करने की आवश्यकता है
वाणिज्यिक क्लाउड एएसआर (जैसे अलीबाबा क्लाउड स्पीच रिकग्निशन एज़्योर स्पीच, व्हिस्पर एपीआई) की तुलना में, प्रति दिन औसतन 100 घंटे ऑडियो प्रोसेसिंग के परिदृश्य में, फ़नएएसआर की स्व-निर्मित तैनाती 3-6 महीनों के भीतर हार्डवेयर लागत को पुनर्प्राप्त कर सकती है।
फ़नएएसआर के अनुप्रयोग परिदृश्य
- मीटिंग रिकॉर्ड और इंटेलिजेंट मिनट्स: स्पीकर टैग के साथ कॉर्पोरेट मीटिंग ऑडियो को स्वचालित रूप से संरचित टेक्स्ट में परिवर्तित करें, और "वॉयस प्रश्न और उत्तर" को लागू करने के लिए आरएजी ज्ञान आधार को एकीकृत करें। मैन्युअल ट्रांसक्रिप्शन की तुलना में, दक्षता 10-20 गुना बढ़ जाती है।
- वीडियो उपशीर्षक और सामग्री उत्पादन: एसआरटी/टीएसवी उपशीर्षक निर्यात का समर्थन करता है, प्रसंस्करण गति 170-340x वास्तविक समय दर। जब नए मीडिया ऑपरेशन बैच वीडियो कॉर्पस को प्रोसेस करते हैं, तो एक घंटे के वीडियो के लिए ट्रांसक्रिप्शन लगभग 10-20 सेकंड में पूरा किया जा सकता है।
- ग्राहक सेवा गुणवत्ता निरीक्षण और भावनात्मक विश्लेषण: SenseVoice स्वचालित रूप से उपयोगकर्ताओं की भावनात्मक स्थिति और प्रमुख ऑडियो घटनाओं (जैसे झगड़े, शिकायत वृद्धि) का पता लगाता है, और गुणवत्ता निरीक्षण टीम को यादृच्छिक निरीक्षण कवरेज दर को 5% से 100% तक बढ़ाने में सहायता करता है।
- एआई वॉयस एजेंट/सहायक: एआई सहायकों के लिए स्थानीय वॉयस इनपुट क्षमताएं प्रदान करने और वॉयस डेटा के बाहरी प्रसारण से बचने के लिए एमसीपी सर्वर या ओपनएआई एपीआई के माध्यम से क्लाउड/कर्सर/डिफाई जैसे एजेंट फ्रेमवर्क से कनेक्ट करें।
- मेडिकल/वित्तीय/कानूनी वॉयस ट्रांसक्रिप्शन: 100% निजीकृत तैनाती, ऑडियो डेटा इंट्रानेट नहीं छोड़ता है, और HIPAA/MLI अनुपालन आवश्यकताओं को पूरा करता है।
सीमाएँ उपयुक्त नहीं:
- वास्तविक समय संचार परिदृश्यों (जैसे कॉन्फ़्रेंस कॉल में वास्तविक समय प्रतिलेखन) के लिए, पैराफॉर्मर स्ट्रीमिंग एंडपॉइंट का उपयोग करने और पहले शब्द विलंब को अनुकूलित करने की अनुशंसा की जाती है
- बहुत छोटी भाषाओं (जैसे अफ्रीकी/मूल अमेरिकी भाषाओं) को स्वयं प्रशिक्षित करने या Qwen3-ASR का उपयोग करने की आवश्यकता है, और कवरेज अधूरा हो सकता है
- इंटरैक्टिव दृश्यों के लिए अत्यधिक उच्च पहचान विलंबता (<50ms) की आवश्यकता होती है, जिसके लिए स्ट्रीमिंग VAD और पैराफॉर्मर के कस्टम अनुकूलन की आवश्यकता होती है।
फ़नएएसआर के लागू समूह
- एआई एप्लिकेशन डेवलपर्स: उत्पादों में आवाज क्षमताओं को एकीकृत करने की आवश्यकता है। फ़नएएसआर बेहद कम एकीकरण लागत के साथ पायथन एसडीके और ओपनएआई संगत एपीआई प्रदान करता है। क्लाउड एएसआर सेवाओं को प्रतिस्थापित करता है और दीर्घकालिक एपीआई शुल्क बचाता है।
- एंटरप्राइज़ एआई टीम: जिन उद्योगों में डेटा गोपनीयता और अनुपालन (चिकित्सा, वित्तीय, कानूनी) के लिए सख्त आवश्यकताएं हैं, उनमें फ़नएएसआर की निजीकृत तैनाती क्षमताओं की तत्काल आवश्यकता है। मॉडल चयन और हार्डवेयर योजना के मूल्यांकन को प्राथमिकता देने की सिफारिश की गई है।
- वॉयस प्रोडक्ट इंटीग्रेटर: आईएसवी/एसआई जिन्हें एएसआर पाइपलाइन को अनुकूलित करने की आवश्यकता है। फ़नएएसआर का मॉड्यूलर आर्किटेक्चर किसी भी घटक के प्रतिस्थापन की अनुमति देता है और फ़ाइन-ट्यून का समर्थन करता है।
- व्यक्तिगत डेवलपर्स और शोधकर्ता: एमआईटी लाइसेंस शैक्षणिक अनुसंधान पर कोई प्रतिबंध नहीं होने के साथ, मुफ्त उपयोग और माध्यमिक विकास की अनुमति देता है। कोलाब क्विक स्टार्ट आपको अपना पहला पहचान कार्य 5 मिनट में पूरा करने देता है।
- परिदृश्यों के लिए उपयुक्त नहीं: शून्य-कोड/गैर-तकनीकी उपयोगकर्ताओं द्वारा प्रत्यक्ष उपयोग, वर्तमान में मुख्य रूप से पायथन/सीएलआई/एपीआई के माध्यम से इंटरैक्ट किया जाता है, कोई ग्राफिकल इंटरफ़ेस नहीं; ऐसे परिदृश्य जिनमें एंड-टू-एंड SaaS आउट-ऑफ़-द-बॉक्स उपयोग की आवश्यकता होती है, तृतीय-पक्ष UI पैकेजिंग का उपयोग करने की अनुशंसा की जाती है।
फ़नएएसआर का सारांश और आउटलुक
फ़नएएसआर वर्तमान में ओपन सोर्स समुदाय में सबसे पूर्ण और सबसे उन्नत औद्योगिक-ग्रेड वाक् पहचान टूलकिट है। इसकी मुख्य प्रतिस्पर्धात्मकता "मल्टी-मॉडल संयोजन + अंतिम तर्क दक्षता + पूर्ण स्पेक्ट्रम परिनियोजन समाधान" की त्रिमूर्ति में निहित है: डेवलपर्स परिदृश्य के अनुसार एएसआर/वीएडी/विराम चिह्न/स्पीकर पृथक्करण मॉडल को स्वतंत्र रूप से जोड़ सकते हैं, वीएलएलएम के माध्यम से 340x वास्तविक समय दर प्राप्त कर सकते हैं, और इसे किसी भी तरह से तैनात कर सकते हैं जैसे कि पायथन एसडीके / ओपनएआई एपीआई / एमसीपी / llama.cpp।
वर्तमान सीमाएँ:
- दस्तावेज़ और ट्यूटोरियल अभी भी मुख्य रूप से अंग्रेजी और चीनी में हैं, और जापानी/कोरियाई दस्तावेज़ निर्माणाधीन हैं
- कुछ मॉडलों (फन-एएसआर-नैनो) को जीपीयू पर चलाने की सिफारिश की गई है, सीपीयू उपलब्ध है लेकिन सेंसवॉइसस्मॉल को चुनने की जरूरत है
- वास्तविक समय वेबसॉकेट सेवाओं को अभी भी उच्च-समवर्ती परिदृश्यों में विशिष्ट हार्डवेयर के लिए मापदंडों को ट्यून करने की आवश्यकता है
अधिग्रहण/गोद लेने का जोखिम मूल्यांकन: फ़नएएसआर खुला स्रोत है, मुफ़्त है और एमआईटी लाइसेंस प्राप्त है, जिसमें गोद लेने का जोखिम बेहद कम है। एंटरप्राइज़ परिनियोजन से पहले, प्रतिनिधि ऑडियो डेटा पर सीईआर और आरटीएफ बेंचमार्क परीक्षण करने और सबसे उपयुक्त मॉडल संयोजन का चयन करने की अनुशंसा की जाती है (सत्यापन के लिए इसे SenseVoiceSmall से शुरू करने की अनुशंसा की जाती है)। दीर्घकालिक निर्भरता का जोखिम मुख्य रूप से सामुदायिक रखरखाव की निरंतरता से आता है, लेकिन अलीबाबा टोंगी लैब और मॉडलस्कोप का निरंतर निवेश (2025-2026 में प्रति माह औसतन 2-3 संस्करण अपडेट) अच्छी सुरक्षा प्रदान करता है। जिन उद्यमों को व्यावसायिक समर्थन की आवश्यकता होती है, उनके लिए अलीबाबा क्लाउड वाक् पहचान उत्पादों को एक विकल्प के रूप में माना जा सकता है। सारांश: अंतर्निहित एएसआर इंजन के रूप में, फनएएसआर तकनीकी संकेतकों और अनुपालन स्वतंत्रता के मामले में क्लोज्ड-सोर्स क्लाउड एपीआई और व्हिस्पर के स्व-निर्मित समाधानों से बेहतर है, और "स्पीच-टू-टेक्स्ट" इंफ्रास्ट्रक्चर परत के लिए पसंदीदा ओपन सोर्स टूलकिट है।
संबंधित उपकरण: इलेवनलैब्स, udio
संस्करण जानकारी
- v1.3.19 :वास्तविक समय WebSocket लंबा सत्र समस्या निवारण दस्तावेज़ जोड़ा गया; सीएलआई एसआरटी/टीएसवी उपशीर्षक आउटपुट सुधार; क्लाइंट-संचालित रीयल-टाइम एंडपॉइंट फ़न-एएसआर-नैनो का समर्थन करता है।
- v1.3.18 :सीएलआई एसआरटी/टीएसवी उपशीर्षक आउटपुट खंडित उपशीर्षक संकेत लिखने के लिए वाक्य टाइमस्टैम्प का उपयोग करता है।
- v1.3.16 :सर्वर-साइड VAD के बिना स्ट्रीमिंग पहचान के लिए क्लाइंट-संचालित रीयल-टाइम वेबसॉकेट एंडपॉइंट जोड़ा गया।
- v1.3.12 :Qwen3-ASR भाषा कोड ठीक करें GLM-ASR ठीक करें vLLM पुनरावृत्ति_दंड ठीक करें।
- v1.3.3 :funasr-सर्वर सीएलआई, ओपनएआई संगत एपीआई, एआई एजेंटों के लिए एमसीपी सर्वर और डायनेमिक वीएडी जोड़ा गया।
उपयोगकर्ता समीक्षाएं