एयरो-1-ऑडियो मुफ्त

-

एयरो-1-ऑडियो एलएमएम-लैब द्वारा विकसित एक हल्का ऑडियो मॉडल है, जो केवल 150 मिलियन मापदंडों के साथ क्वेन-2.5-1.5बी पर बनाया गया है। लंबी ऑडियो प्रोसेसिंग के लिए डिज़ाइन किया गया, बिना विभाजन के 15 मिनट के निरंतर ऑडियो इनपुट का समर्थन करता है। इसमें वाक् पहचान (एएसआर) कार्यों में उच्च सटीकता है और एएमआई, लिब्रिस्पीच, एसपीजीआईस्पीच और अन्य डेटा सेट पर शब्द त्रुटि दर सबसे कम है।

एयरो-1-ऑडियो उत्पाद इंटरफेस

एयरो-1-ऑडियो

मुख्य पैरामीटर और आँकड़े

पैरामीटर्स आधिकारिक सत्यापन योग्य जानकारी
उत्पाद स्थिति लंबे प्रारूप वाले ऑडियो के लिए हल्के ऑडियो मॉडल
मूल मॉडल क्वेन-2.5-1.5बी
पैरामीटर राशि 150 मिलियन (150M)
अधिकतम ऑडियो लंबाई 15 मिनट तक लगातार इनपुट
प्रशिक्षण डेटा ~5 बिलियन टोकन (50,000 घंटे का ऑडियो)
प्रशिक्षण संसाधन 16 एच100 जीपीयू, 1 दिन में पूरा हुआ
फ्लॉप उपयोग 0.34 (अनुक्रम पैकिंग के साथ अनुकूलित)
प्रकाशन मंच गले मिलता हुआ चेहरा

एक संक्षिप्त टिप्पणी: एयरो-1-ऑडियो ने यह साबित करने के लिए 150 मिलियन मापदंडों का उपयोग किया कि छोटे मॉडल ऑडियो कार्यों में व्हिस्पर जैसे बड़े मॉडल से आगे निकल सकते हैं।

उपयोगकर्ता और बाज़ार की पहचान

धीरे-धीरे क्षेत्र में उपयोगकर्ता जागरूकता पैदा करें, और कार्य कुशलता में सुधार के लिए सामग्री निर्माताओं और टीमों द्वारा उत्पाद क्षमताओं का उपयोग किया जाता है। कुछ उद्योग उपयोगकर्ताओं ने इसे अपने दैनिक वर्कफ़्लो में शामिल किया है। विशिष्ट उपयोगकर्ता पैमाने और उद्योग अपनाने की दर डेटा के लिए नवीनतम आधिकारिक खुलासे को संदर्भित करने की अनुशंसा की जाती है।

लागत लाभ

सी-साइड/पर्सनल: पूरी तरह से खुला स्रोत और मुफ़्त, आप इसे हगिंग फेस से डाउनलोड और उपयोग कर सकते हैं। आपको अपना खुद का तर्कपूर्ण संदर्भ (जीपीयू अनुशंसित) तैयार करना होगा।

डेवलपर्स: मुफ़्त और खुला स्रोत, आपके अपने अनुप्रयोगों में एकीकृत किया जा सकता है। 16 एच100 प्रशिक्षण 1-दिवसीय कम लागत वाली प्रशिक्षण व्यवस्था जो अनुसंधान टीम के अनुकूल है।

उद्यम/निजी: खुला स्रोत स्व-तैनाती और फाइन-ट्यूनिंग की अनुमति देता है। एमआईटी जैसे खुले लाइसेंस व्यावसायिक उपयोग की अनुमति देते हैं (विशिष्ट लाइसेंस आधिकारिक के अधीन होगा)।

मुख्य कार्य

  • लंबी ऑडियो प्रोसेसिंग: प्रासंगिक सुसंगतता बनाए रखते हुए, विभाजन के बिना 15 मिनट तक निरंतर ऑडियो इनपुट का समर्थन करता है।
  • वाक् पहचान (एएसआर): उच्च सटीकता वाले वाक्-से-पाठ रूपांतरण, वास्तविक समय प्रतिलेखन, बैठक मिनट और व्याख्यान प्रतिलेखन के लिए उपयुक्त।
  • जटिल ऑडियो विश्लेषण: भाषण, ध्वनि प्रभाव, संगीत इत्यादि जैसे कई ऑडियो प्रकारों के विश्लेषण और अर्थ संबंधी समझ का समर्थन करता है।
  • कमांड-संचालित कार्य: ऑडियो से विशिष्ट जानकारी निकालें या निर्देशों के आधार पर विशिष्ट संचालन करें।
  • हल्का और कुशल: केवल 150 मिलियन पैरामीटर, कई बेंचमार्क में बड़े व्हिस्पर और क्वेन-2-ऑडियो से बेहतर प्रदर्शन।

मॉडल और संस्करण विकास

निरंतर पुनरावृत्त अद्यतन, नवीनतम संस्करण प्रदर्शन अनुकूलन और नई सुविधाएँ पेश करता है। ऐतिहासिक संस्करण की जानकारी आधिकारिक रिलीज़ पृष्ठ पर देखी जा सकती है। अभी तक कोई पूर्ण सार्वजनिक संस्करण विकास समयरेखा नहीं है। फीचर अपडेट की लय को समझने के लिए आधिकारिक घोषणा पर ध्यान देने की सिफारिश की जाती है।

तकनीकी लाभ

मुख्य प्रकार का निर्णय: बुनियादी बड़े मॉडल/एपीआई बुनियादी ढांचे - हल्के ओपन सोर्स ऑडियो मॉडल।

प्रदर्शन और थ्रूपुट: केवल 16 एच100 जीपीयू पर 1 दिन का प्रशिक्षण। अनुक्रम पैकिंग तकनीक के माध्यम से अनुमान चरण में फ्लॉप उपयोग को 0.03 से 0.34 तक सुधारा गया है। टीटीएफटी और टीपीएम/आरपीएम जैसे ऑनलाइन सेवा संकेतक सार्वजनिक नहीं हैं और आधिकारिक हगिंग फेस पेज के अधीन हैं।

अनुकूलन सीमा: वाक् पहचान (एएसआर) और लंबे ऑडियो समझने के कार्यों में सर्वश्रेष्ठ। ध्वनि आदेशों का पालन करने और ऑडियो दृश्यों को समझने में उत्कृष्ट प्रदर्शन। लेकिन यह संगीत निर्माण और वाक् संश्लेषण (टीटीएस) जैसे जेनरेटिव ऑडियो कार्यों में अच्छा नहीं है।

प्रशिक्षण विधि: नमूनों को पूर्वनिर्धारित टोकन लंबाई सीमा में समूहित करके कंप्यूटिंग संसाधन उपयोग में सुधार करने के लिए टोकन लंबाई के आधार पर एक गतिशील बैच प्रसंस्करण रणनीति अपनाएं।

कैसे उपयोग करें

प्रवेश विवरण
गले मिलता हुआ चेहरा मॉडल डाउनलोड करने के लिए huggingface.co/lmms-lab/Aero-1-Audio पर जाएं
स्थानीय अनुमान अनुमान के लिए मॉडल को ट्रांसफॉर्मर्स लाइब्रेरी के माध्यम से लोड करें

उत्पाद का मूल्य निर्धारण

मूल्य निर्धारण मॉडल आधिकारिक वास्तविक समय पृष्ठ के अधीन है। आमतौर पर फ्रीमियम या सदस्यता प्रणाली का उपयोग किया जाता है, और बुनियादी कार्यों का उपयोग मुफ्त में किया जा सकता है। उन्नत कार्यों या उच्च-आवृत्ति उपयोग के लिए सशुल्क सदस्यता की आवश्यकता होती है, और उपयोगकर्ताओं को वास्तविक उपयोग के आधार पर इष्टतम समाधान का मूल्यांकन करने की सलाह दी जाती है।

अनुप्रयोग परिदृश्य

  • वॉयस असिस्टेंट: बुद्धिमान वॉयस असिस्टेंट के लिए कुशल वाक् पहचान और समझने की क्षमता प्रदान करता है।
  • वास्तविक समय प्रतिलेखन: बैठकों, व्याख्यानों आदि के लिए उपयुक्त ध्वनि सामग्री को पाठ में त्वरित रूप से प्रतिलेखित करें।
  • ऑडियो संग्रह और खोज: ऑडियो लाइब्रेरी में सामग्री टैग जोड़ें और सिमेंटिक खोज का समर्थन करें।
  • एजेंट लिसनिंग मॉड्यूल: एजेंट को लंबे भाषण को समझने की क्षमता देता है और कई दौर के संवाद का समर्थन करता है।

लागू लोग

  • व्यक्तिगत उपयोगकर्ता: सामग्री निर्माता और ज्ञान कार्यकर्ता जिन्हें अपनी दैनिक कार्य कुशलता में सुधार के लिए एआई सहायता की आवश्यकता होती है।
  • डेवलपर्स: तकनीकी टीमें जिन्हें एपीआई के माध्यम से एआई क्षमताओं को अपने उत्पादों या सेवाओं में एकीकृत करने की आवश्यकता है।
  • उद्यम: संगठन अपने क्षेत्र में बड़े पैमाने पर एआई को तैनात करना चाहते हैं।

सारांश और आउटलुक

एयरो-1-ऑडियो छोटे मॉडलों के साथ बड़ी समस्याओं को हल करने की इंजीनियरिंग क्षमताओं को प्रदर्शित करता है - 150 मिलियन पैरामीटर + 50,000 घंटे का प्रशिक्षण डेटा, एएसआर बेंचमार्क पर व्हिस्पर को पीछे छोड़ते हुए। प्रशिक्षण दक्षता अनुकूलन समाधान (गतिशील बैच प्रसंस्करण + अनुक्रम पैकेजिंग) का सीमित संसाधनों वाली अनुसंधान टीमों के लिए संदर्भ मूल्य है।

अनुपयुक्त सीमा: वाक् संश्लेषण (टीटीएस) क्षमताएं प्रदान नहीं करता है; अनुमान के लिए GPU संसाधनों की आवश्यकता होती है; मॉडल केवल अंग्रेजी का समर्थन करता है; असंरचित लंबे ऑडियो में स्वर पृथक्करण प्रभाव का खुलासा नहीं किया गया है; एक शोध मॉडल के रूप में, उत्पादन संदर्भ की स्थिरता और समर्थन का मूल्यांकन स्वयं द्वारा किया जाना चाहिए।

खरीद सुझाव: अनुसंधान टीम पुनरुत्पादन और फाइन-ट्यूनिंग के लिए सीधे मॉडल डाउनलोड कर सकती है। उत्पादन में तैनाती से पहले, लक्ष्य डेटा पर एएसआर सटीकता को सत्यापित करना और जीपीयू अनुमान लागत का मूल्यांकन करना आवश्यक है। इस बात पर ध्यान दें कि क्या एलएमएम-लैब भविष्य में एक बड़ा संस्करण या एक समर्पित फाइन-ट्यून संस्करण जारी करेगा।

संबंधित उपकरण: ,

संस्करण जानकारी

  • एयरो-1-ऑडियो रिलीज़ :Qwen-2.5-1.5B पर आधारित, यह 15 मिनट के निरंतर ऑडियो का समर्थन करता है और ASR मल्टी-बेंचमार्क के लिए इष्टतम है।
  • एयरो-1-ऑडियो पूर्वावलोकन :प्रारंभिक पूर्वावलोकन संस्करण, कोर ऑडियो प्रोसेसिंग आर्किटेक्चर सत्यापन।

उपयोगकर्ता समीक्षाएं

  • समीक्षाएं लोड हो रही हैं...