ऑडियोक्राफ्ट

-

ऑडियोक्राफ्ट एक मेटा ओपन सोर्स एआई ऑडियो फ्रेमवर्क है जिसमें म्यूजिकजेन म्यूजिक जेनरेशन, ऑडियोजेन साउंड इफेक्ट जेनरेशन और एनकोडेक ऑडियो कंप्रेशन शामिल है।

ऑडियोक्राफ्ट उत्पाद इंटरफेस

ऑडियोक्राफ्ट

ऑडियोक्राफ्ट के मुख्य पैरामीटर और आँकड़े

AudioCraft मेटा AI रिसर्च इंस्टीट्यूट का ओपन सोर्स PyTorch ऑडियो जेनरेशन फ्रेमवर्क है। इसे आधिकारिक तौर पर "वन-स्टॉप ऑडियो जेनरेशन कोड लाइब्रेरी" के रूप में तैनात किया गया है, जो संगीत निर्माण, ध्वनि प्रभाव संश्लेषण और तंत्रिका ऑडियो संपीड़न के तीन प्रमुख कार्यों को कवर करता है। यह वर्तमान में वैश्विक ओपन सोर्स समुदाय में सबसे लोकप्रिय टेक्स्ट-टू-ऑडियो (टेक्स्ट-टू-ऑडियो) फ्रेमवर्क में से एक है।

प्रोजेक्ट्स सार्वजनिक सूचना
मुख्य घटक म्यूजिकजेन (म्यूजिक जेनरेशन), ऑडियोजेन (ध्वनि प्रभाव जेनरेशन), एनकोडेक (ऑडियो कोडेक), मैग्नेट (ऑडियो के लिए गैर-ऑटोरेग्रेसिव टेक्स्ट), मल्टी बैंड डिफ्यूजन (डिफ्यूजन डिकोडर), जेएएससीओ (कॉर्ड/मेलोडी/ड्रम कंडीशनल जेनरेशन)
मॉडल स्केल MusicGen 300M / 1.5B / 3.3B के तीन पैरामीटर संस्करण प्रदान करता है
इनपुट विधि पाठ विवरण + वैकल्पिक संदर्भ ऑडियो (राग निरंतरता/शैली मार्गदर्शन)
आउटपुट स्वरूप मोनो/स्टीरियो WAV, कई मिनटों तक निरंतर उत्पादन का समर्थन करता है
कोड लाइसेंस एमआईटी लाइसेंस (पूरी तरह से खुला स्रोत)
मॉडल वजन लाइसेंस CC-BY-NC 4.0 (केवल गैर-व्यावसायिक उपयोग)
हार्डवेयर आवश्यकताएँ NVIDIA GPU अनुमान अनुशंसित; 300M संस्करण 6GB वीडियो मेमोरी के साथ उपभोक्ता-ग्रेड ग्राफिक्स कार्ड पर चल सकता है
पायथन संस्करण 3.9+, PyTorch 2.1.0+ पर निर्भर करता है
गिटहब स्टार्स ~23,500 सितारे / ~2,700 कांटे (2026-07 तक)
डेवलपर योगदान 34 योगदानकर्ता, मुख्य रूप से मेटा एआई अनुसंधान टीम से

पैरामीटर स्केल और हार्डवेयर मैपिंग: 300M संस्करण RTX 3060 (6GB) पर वास्तविक समय में अनुमान लगा सकता है; 1.5बी संस्करण 8जीबी+ वीडियो मेमोरी की अनुशंसा करता है; 3.3B संस्करण के लिए 16GB+ वीडियो मेमोरी या मॉडल समानता की आवश्यकता होती है। डेवलपर्स को आंख मूंदकर अधिकतम मापदंडों का पीछा करने के बजाय "उपलब्ध वीडियो मेमोरी के अनुसार मॉडल आकार का चयन करना चाहिए"। 300M पहले से ही अधिकांश लघु वीडियो साउंडट्रैक परिदृश्यों में प्रयोग करने योग्य संगीत क्लिप का उत्पादन कर सकता है।

सामुदायिक गतिविधि: GitHub रिपॉजिटरी में लगभग 23.5k सितारे, 2.7k फ़ोर्क और 34 योगदानकर्ता हैं। यद्यपि मुख्य रिपॉजिटरी में अंतिम सक्रिय सबमिशन एक वर्ष से अधिक समय पहले हुआ था, हगिंग फेस पर मॉडल वेट के डाउनलोड की संख्या लगातार बढ़ रही है, यह दर्शाता है कि उपभोक्ता पक्ष पर समुदाय की लोकप्रियता कम नहीं हुई है।

ऑडियोक्राफ्ट के उपयोगकर्ता और बाज़ार की पहचान

ऑडियोक्राफ्ट की बाजार पहचान ओपन सोर्स अनुसंधान समुदाय और एप्लिकेशन डेवलपर्स के स्तर पर केंद्रित है, और वाणिज्यिक ग्राहकों की संख्या और राजस्व डेटा का आधिकारिक तौर पर खुलासा नहीं किया गया है।

गिटहब इकोलॉजिकल सिग्नल: 23.5k स्टार्स और 2.7k फोर्क्स संकेत देते हैं कि ऑडियोक्राफ्ट ने शुरुआती प्रायोगिक चरण को पार कर लिया है और एआई ऑडियो ओपन सोर्स प्रोजेक्ट्स में शीर्ष स्थान पर है। बड़ी संख्या में तृतीय-पक्ष व्युत्पन्न परियोजनाएं (जैसे ग्रैडियो वेबयूआई, कोलाब नोटबुक हगिंग फेस स्पेस ऑनलाइन डेमो) इसके चारों ओर एक पारिस्थितिकी तंत्र बनाती हैं।

अकादमिक उद्धरण: म्यूज़िकजेन पेपर को न्यूरआईपीएस 2023 द्वारा स्वीकार किया गया था, और इसकी वास्तुकला के आसपास व्युत्पन्न अनुसंधान और प्रतिकृति परियोजनाएं सामने आती रहती हैं। दो पत्रों म्यूज़िकजेन और ऑडियोजेन के संयुक्त उद्धरण ऑडियो जेनरेशन क्षेत्र में सबसे आगे आ गए हैं।

उद्योग अनुप्रयोग कवरेज: कई गेम स्टूडियो और स्वतंत्र सामग्री निर्माताओं ने प्रौद्योगिकी ब्लॉगों में ऑडियोक्राफ्ट पर आधारित ध्वनि प्रभाव पाइपलाइनों का खुलासा किया है; हालाँकि, मेटा ने स्वयं किसी भी उद्यम-स्तरीय वाणिज्यिक मामले की घोषणा नहीं की है, और व्यावसायीकरण पूरी तरह से समुदाय और तीसरे पक्षों पर निर्भर करता है।

बी-साइड अपनाने की बाधा: मॉडल वज़न CC-BY-NC 4.0 लाइसेंस का उपयोग करते हैं, जिसका अर्थ है कि व्यावसायिक उपयोग के लिए मेटा से अलग प्राधिकरण की आवश्यकता होती है। यह उद्यम-स्तर पर अपनाने में मुख्य अनिश्चितता है, और यह संरचनात्मक कारण भी है कि वर्तमान बाजार मान्यता "प्रशंसनीय है लेकिन लोकप्रिय नहीं है"।

ऑडियोक्राफ्ट का लागत लाभ

ऑडियोक्राफ्ट का "लागत लाभ" सास-शैली पे-एज़-यू-गो बिलिंग की स्पष्ट कम कीमत के बजाय शून्य लाइसेंस शुल्क मॉडल पहुंच और स्थानीय तैनाती के लिए कंप्यूटिंग शक्ति के आत्म-नियंत्रण में निहित है।

सी ग्राहक/व्यक्तिगत उपयोगकर्ता: पूरी तरह से शून्य लागत। आप सीधे GitHub से कोड खींच सकते हैं, हगिंग फेस से मॉडल वेट डाउनलोड कर सकते हैं और इसे स्थानीय रूप से चला सकते हैं, या आधिकारिक डेमो पेज के माध्यम से इसे ऑनलाइन अनुभव कर सकते हैं। एकमात्र लागत स्थानीय जीपीयू हार्डवेयर और बिजली की खपत है; 300M मॉडल उपभोक्ता-ग्रेड ग्राफिक्स कार्ड पर चलता है, और प्रति समय उत्पन्न बिजली बिल नगण्य है।

डेवलपर्स/एपीआई उपयोगकर्ता: मॉडल स्वयं मुफ़्त है, लेकिन अनुमान को तैनात करने के लिए आपके स्वयं के जीपीयू बुनियादी ढांचे की आवश्यकता होती है। क्लाउड जीपीयू इंस्टेंसेस (जैसे आरटीएक्स 4090 ऑन-डिमांड इंस्टेंसेस) का उपयोग करके अनुमानित, एक 30-सेकंड संगीत पीढ़ी की कम्प्यूटेशनल लागत लगभग यूएस$0.01-0.03 है। इसकी तुलना में, वाणिज्यिक एपीआई (जैसे ओपनएआई ज्यूकबॉक्स जैसी सेवाएं) की प्रति कॉल लागत आम तौर पर 10-50 गुना अधिक है। यदि टीम के पास पहले से ही एक GPU क्लस्टर है, तो AudioCraft की सीमांत अनुमान लागत शून्य तक पहुंच सकती है।

उद्यम/निजी: कोई लाइसेंस शुल्क नहीं, लेकिन आपको पूर्ण मॉडल परिनियोजन और संचालन लागत वहन करनी होगी: जीपीयू सर्वर खरीद या क्लाउड इंस्टेंस रेंटल पायथन प्रासंगिक रखरखाव, मॉडल संस्करण प्रबंधन, और अनुमान एपीआई पैकेजिंग। बजट की तुलना करते समय, कॉर्पोरेट अधिकारियों को केवल "खुले स्रोत और मुफ़्त" की तुलना "स्वामित्व की कुल लागत शून्य" से नहीं करनी चाहिए। संचालन और रखरखाव जनशक्ति, GPU अद्यतन चक्र और तकनीकी ऋण अक्सर SaaS सेवाओं के लिए सदस्यता शुल्क से अधिक होते हैं।

छिपी हुई लागत: CC-BY-NC 4.0 लाइसेंस के मॉडल भार का उपयोग सीधे व्यावसायिक उपयोग के लिए नहीं किया जा सकता है। यदि किसी उद्यम को वाणिज्यिक प्राधिकरण की आवश्यकता है, तो उसे मेटा कानूनी टीम के साथ अलग से शर्तों की पुष्टि करनी होगी। इस प्रक्रिया के कारण अप्रत्याशित कानूनी लागत और समय की देरी हो सकती है। इसके अलावा, ओपन सोर्स प्रोजेक्ट्स की रखरखाव लय अनियंत्रित है - मुख्य गोदाम का नवीनतम सबमिशन एक साल से अधिक समय पहले हुआ है, और एक निष्क्रिय अपस्ट्रीम प्रोजेक्ट पर दीर्घकालिक निर्भरता में प्रौद्योगिकी स्टैक जोखिम शामिल हैं।

ऑडियोक्राफ्ट के मुख्य कार्य

ऑडियोक्राफ्ट की क्षमताएं "ऑडियो जेनरेशन + ऑडियो एन्कोडिंग" की दो मुख्य लाइनों के इर्द-गिर्द घूमती हैं। कोर मॉडल समूह संगीत से लेकर परिवेशी ध्वनि से लेकर संपीड़न तक संपूर्ण लिंक को कवर करता है।

  • म्यूजिकजेन (संगीत के लिए पाठ/राग): संबंधित शैली के संगीत क्लिप उत्पन्न करने के लिए पाठ विवरण (जैसे "सुखदायक पियानो जैज़") प्राप्त करता है; मेलोडी कंडीशनिंग (मेलोडी कंडीशनिंग) का समर्थन करता है - एक गुनगुना या तैयार मेलोडी अपलोड करें, और मॉडल इसके आधार पर एक पूरी व्यवस्था लिखना जारी रखेगा। स्वीकृति संबंधी चिंताएं: लंबे ऑडियो (30 सेकंड से अधिक) में संरचनात्मक सुसंगतता अभी भी सीमित है, और पैराग्राफ के दूसरे भाग में विषय भटकने का खतरा है।
  • ऑडियोजेन (पाठ से ध्वनि प्रभाव): परिवेशीय ध्वनि प्रभाव और ओनोमेटोपोइया पीढ़ी में विशेषज्ञता। संबंधित ध्वनि प्रभाव क्लिप को आउटपुट करने के लिए "बारिश से टकराने वाली खिड़कियां", "कुत्ते का भौंकना", "यातायात शोर" आदि जैसे विवरण दर्ज करें। स्वीकृति संबंधी चिंताएं: सटीक समय को नियंत्रित करने की क्षमता (जैसे कि ठीक तीसरे सेकंड में विस्फोट ध्वनि उत्पन्न करना) कमजोर है, और "सटीक ओनोमेटोपोइया" के बजाय "परिवेशीय ध्वनि प्रभावों" के लिए अधिक उपयुक्त है।
  • एनकोडेक (न्यूरल ऑडियो कोडेक): मेटा का स्व-विकसित एंड-टू-एंड न्यूरल ऑडियो कंप्रेशन मॉडल, जो मूल ऑडियो को अलग टोकन स्ट्रीम में मैप करता है, म्यूजिकजेन/ऑडियोजेन की अंतर्निहित कोडिंग नींव है। 1.5 केबीपीएस से 24 केबीपीएस तक परिवर्तनीय दरों के लिए समर्थन बाद के मॉडलों के लिए अलग ऑडियो प्रतिनिधित्व प्रदान करता है।
  • MAGNeT (नॉन-ऑटोरेग्रेसिव एक्सटेंशन): MusicGen आर्किटेक्चर पर आधारित एक नॉन-ऑटोरेग्रेसिव समानांतर डिकोडिंग रणनीति का परिचय। अनुमान की गति ऑटोरेग्रेसिव बेसलाइन की तुलना में कई गुना अधिक है, जो इसे विलंब-संवेदनशील वास्तविक समय पीढ़ी परिदृश्यों के लिए उपयुक्त बनाती है।
  • JASCO (मल्टी-कंडीशनल म्यूजिक जेनरेशन): नवीनतम विस्तारित मॉडल (v1.4.0a2) संगीत निर्माण प्रक्रिया में स्पष्ट स्थिति इनपुट के रूप में कॉर्ड प्रोग्रेस, मेलोडी लाइन और ड्रम ट्रैक का उपयोग करने का समर्थन करता है, जो उन्नत परिदृश्यों के लिए उपयुक्त है जिन्हें सटीक व्यवस्था नियंत्रण की आवश्यकता होती है।
  • मल्टी बैंड डिफ्यूजन (डिफ्यूजन डिकोडिंग एन्हांसमेंट): एनकोडेक के वैकल्पिक डिकोडर के रूप में, यह संपीड़न दक्षता को बनाए रखते हुए उत्पन्न ऑडियो की निष्ठा में सुधार करने के लिए मल्टी-बैंड डिफ्यूजन मॉडल का उपयोग करता है।
  • ऑडियोसील (ऑडियो वॉटरमार्क): अंतर्निहित एआईजीसी ऑडियो वॉटरमार्क टूल एआई सामग्री के स्रोत ट्रेसिंग और कॉपीराइट सुरक्षा के लिए उत्पन्न ऑडियो में मानव कान के लिए अदृश्य टैग एम्बेड करने का समर्थन करता है।

कार्यों के बीच तालमेल: एनकोडेक सिर्फ एक स्टैंडअलोन संपीड़न उपकरण से कहीं अधिक है - यह म्यूजिकजेन, ऑडियोजेन और एमएजीनेट के लिए एक एकीकृत असतत टोकन प्रतिनिधित्व परत प्रदान करता है, जो तीन जेनरेटर मॉडल को एन्कोडिंग सिमेंटिक स्पेस के समान सेट को साझा करने की अनुमति देता है, जिससे डिकोडर को "गुणवत्ता बनाम गति" ट्रेड-ऑफ प्राप्त करने के लिए अनुमान पाइपलाइन में विनिमेय बनाया जा सकता है। इसका मतलब यह है कि डेवलपर्स जेनरेशन मॉडल को बदले बिना एनकोडेक डिकोडर को मल्टी बैंड डिफ्यूजन से बदलकर एक क्लिक से ध्वनि की गुणवत्ता में सुधार कर सकते हैं।

ऑडियोक्राफ्ट मॉडल और संस्करण विकास

ऑडियोक्राफ्ट का संस्करण इतिहास GitHub टैग पर आधारित है। जून 2023 में इसकी प्रारंभिक रिलीज के बाद से, इसने एक शोध प्रोटोटाइप से मल्टी-मॉडल ढांचे तक विकास का अनुभव किया है।

आरंभिक रिलीज़ (v0.0.1 - v0.0.2)

  • v0.0.1 (2023-06-09): प्रारंभिक ओपन सोर्स रिलीज़, इसमें केवल मॉडल मूल्यांकन कोड शामिल है और यह प्रशिक्षण योग्य नहीं है। पेपर "सिंपल एंड कंट्रोलेबल म्यूजिक जेनरेशन" के लिए सहायक ओपन सोर्स सामग्री के रूप में जारी किया गया।
  • v0.0.2 (2023-08-01): एक्सटेंडेड जेनरेशन (अनंत लंबाई गणना) और PyTorch 2.0 मेमोरी कुशल ध्यान का समर्थन करने के लिए ग्रैडियो स्थानीय डेमो जोड़ा गया। टॉप-पी सैंपलिंग समस्या को ठीक किया गया और क्लिपिंग को रोकने के लिए कंप्रेसर आउटपुट में टैन जोड़ा गया।

प्रशिक्षण क्षमता खुली (v1.0.0 - v1.1.0)

  • v1.0.0 (2023-09-07): माइलस्टोन संस्करण। EnCodec, AudioGen, MusicGen और मल्टी बैंड डिफ्यूजन के लिए संपूर्ण प्रशिक्षण कोड जोड़ा गया, और AudioGen पूर्व-प्रशिक्षित वेट जारी किया गया। ऑडियोक्राफ्ट के "मॉडल प्रदर्शन" से "प्रशिक्षण योग्य ढांचे" में अपग्रेड को चिह्नित करता है।
  • v1.1.0 (2023-11-06): टॉर्चऑडियो पर सीधी निर्भरता हटाएं और इसके बजाय ऑडियो I/O को संभालने के लिए ffmpeg CLI का उपयोग करें। सीएफजी (क्लासिफायर-फ्री गाइडेंस) कवरेज समस्या और सीएलएपी नमूनाकरण दर त्रुटि को ठीक किया गया। तीन पश्चगामी-असंगत परिवर्तन पेश किए गए (विवरण के लिए चेंजलॉग देखें)।

स्टीरियो और आर्किटेक्चर एक्सटेंशन (v1.2.0 - v1.3.0)

  • v1.2.0 (2024-01-11): क्रिटिकल रिलीज़। स्टीरियो मॉडल के लिए अतिरिक्त समर्थन; समस्या का समाधान किया गया जहां प्रतिबद्धता हानि केवल आरवीक्यू की पहली परत पर लागू की गई थी; लोडिंग स्थिरता बनाए रखने के लिए एलएम चौकियों से संपीड़ित मॉडल स्थिति को हटा दिया गया।
  • v1.3.0 (2024-05-02): ग्रैडियो डेमो के साथ मैग्नेट नॉन-ऑटोरेग्रेसिव मॉडल और इसके हगिंग फेस चेकपॉइंट को एकीकृत करें। टाइपो और setup.py पैकेजिंग स्कोप को ठीक करें। PyTorch 2.1.0 के लिए FSDP (पूरी तरह से साझा डेटा समानांतर) समर्थन जोड़ा गया।

प्रायोगिक शाखा (v1.4.0a)

  • v1.4.0a1 (2024-06-03): अल्फा संस्करण। ऑडियोसील वॉटरमार्क प्रशिक्षण कोड और PESQ ऑडियो गुणवत्ता मूल्यांकन सूचकांक जोड़ा गया; गुलाबी शोर उत्पन्न करना, पुन: नमूनाकरण और फ़िल्टरिंग जैसे ऑडियो एन्हांसमेंट टूल जोड़े गए।
  • v1.4.0a2 (2025-01-14): अल्फा संस्करण। जेएएससीओ मॉडल (सशर्त संगीत निर्माण, कॉर्ड/मेलोडी/ड्रम स्थितियों का समर्थन) जारी किया गया, और संबंधित चेकपॉइंट्स को एक साथ हगिंग फेस पर अपलोड किया गया।

संस्करण फ़ीचर सारांश: ऑडियोक्राफ्ट ने 2023 की दूसरी छमाही में गहन फ़ीचर पुनरावृत्तियों का अनुभव किया (हर 2-3 महीने में एक आधिकारिक संस्करण)। 2024 में प्रवेश करने के बाद गति धीमी हो गई, और v1.4.0 अल्फा चरण में रहा। जुलाई 2026 तक, नवीनतम स्थिर संस्करण v1.3.0 (2024-05-02) है। उत्पादन परिनियोजन की योजना बनाते समय टीमों को आधारभूत मूल्यांकन के रूप में v1.3.0 का उपयोग करना चाहिए, और JASCO और AudioSeal जैसी अल्फा सुविधाओं पर नज़र रखनी चाहिए, लेकिन वे अभी तक उत्पादन के लिए उपयुक्त नहीं हैं।

ऑडियोक्राफ्ट के तकनीकी लाभ

ऑडियोक्राफ्ट का तकनीकी लाभ किसी एकल मॉडल के प्रदर्शन की सफलता में नहीं है, बल्कि "मॉडल के बीच साझा टोकन प्रतिनिधित्व परत" के वास्तुशिल्प डिजाइन और "ऑटोरेग्रेसिव + नॉन-ऑटोरेग्रेसिव + डिफ्यूजन" के ट्रिपल डिकोडिंग पथ के लचीलेपन में निहित है।

यूनिफाइड कोडिंग लेयर (एनकोडेक): सभी जेनरेटिव मॉडल एनकोडेक को फ्रंट एंड के रूप में साझा करते हैं, जो मूल ऑडियो सिग्नल को एक अलग टोकन अनुक्रम में मैप करता है। इस साझा परत का प्रत्यक्ष प्रभाव यह है कि नए जेनरेटिव मॉडल (MAGNeT, JASCO) प्रशिक्षित एनकोडेक एनकोडर/डिकोडर का पुन: उपयोग कर सकते हैं और केवल मध्यवर्ती एलएम या प्रसार घटक को प्रशिक्षित करने की आवश्यकता है, जिससे प्रशिक्षण डेटा और कंप्यूटिंग संसाधनों में बार-बार होने वाले निवेश को काफी कम किया जा सकता है।

टोकन इंटरलीविंग रणनीति: ऑडियोक्राफ्ट मल्टी-स्ट्रीम समानांतर टोकन के लिए एक सरल इंटरलीविंग मोड अपनाता है। पिछले काम से अलग जिसमें कई धाराओं को अलग से मॉडलिंग करने की आवश्यकता होती है, एकल ऑटोरेग्रेसिव एलएम एक विशिष्ट टोकन ऑर्डर के माध्यम से ऑडियो की दीर्घकालिक निर्भरता और स्थानीय विवरण को एक साथ कैप्चर करता है। यह तंत्र सीधे तौर पर बताता है कि "ऑडियोक्राफ्ट एक ही समय में संगीत और ध्वनि प्रभावों को संसाधित करने के लिए एक ही मॉडल का उपयोग क्यों कर सकता है": यह मॉडल आर्किटेक्चर परत पर विभिन्न ऑडियो प्रकारों के लिए समर्पित मॉड्यूल डिज़ाइन नहीं करता है, लेकिन एलएम को टोकन पैटर्न सीखने की अनुमति देता है जो डेटा से संगीत और ध्वनि प्रभावों को अलग करता है।

ट्रिपल डिकोडिंग पारिस्थितिकी: एक ही एलएम द्वारा टोकन आउटपुट को तीन डिकोडर्स - मूल एनकोडेक (सबसे तेज, बुनियादी गुणवत्ता), मल्टी बैंड डिफ्यूजन (धीमी, उच्च निष्ठा), और भविष्य के समुदाय से कस्टम डिकोडर्स के माध्यम से तरंग रूप में वापस लाया जा सकता है। "एक बार पीढ़ी, बहु-स्तरीय डिकोडिंग" का यह लचीलापन डेवलपर्स को मॉडल को फिर से प्रशिक्षित किए बिना अनुमान चरण के दौरान गुणवत्ता/स्पीड ट्रेड-ऑफ करने की अनुमति देता है।

हगिंग फेस इकोलॉजिकल इंटीग्रेशन: मॉडल वेट को हगिंग फेस हब में होस्ट किया जाता है और इसे सीधे ट्रांसफॉर्मर और ऑडियोक्राफ्ट लाइब्रेरी के माध्यम से लोड किया जा सकता है। समुदाय ने इसके चारों ओर वेब यूआई, एपीआई रैपर और एमसीपी कनेक्टर बनाए हैं, जिससे अनुसंधान कोड से कामकाजी सेवाओं तक इंजीनियरिंग बाधा कम हो गई है।

सीमा नोट: ऑडियोक्राफ्ट विशेष रूप से वाक् संश्लेषण (टीटीएस) की दिशा में अनुकूलित नहीं है और विशेष वाक् संश्लेषण मॉडल (जैसे बार्क, वीएएलएल-ई) को बदलने के लिए उपयुक्त नहीं है। इसके चीनी गीतों का उच्चारण भी चीनी के लिए अनुकूलित व्यावसायिक योजनाओं की तुलना में कम सटीक है।

ऑडियोक्राफ्ट का उपयोग कैसे करें

ऑडियोक्राफ्ट के उपयोग पोर्टलों को तीन श्रेणियों में विभाजित किया गया है: ऑनलाइन अनुभव, स्थानीय पायथन अनुमान और स्व-स्वामित्व वाला मॉडल प्रशिक्षण।

ऑनलाइन अनुभव: मेटा के आधिकारिक डेमो पेज (audiocraft.metademolab.com) के माध्यम से, आप स्थानीय जीपीयू की आवश्यकता के बिना सीधे MusicGen और AudioGen की मुख्य पीढ़ी क्षमताओं को आज़मा सकते हैं। गैर-तकनीकी उपयोगकर्ताओं के लिए पीढ़ी प्रभाव का त्वरित मूल्यांकन करने के लिए उपयुक्त।

मूल पायथन अनुमान (अनुशंसित पथ):

# इंस्टॉल करें
पिप इंस्टाल -यू ऑडियोक्राफ्ट

#MusicGen अनुमान उदाहरण
Audiocraft.models से MusicGen आयात करें
Audiocraft.data.audio से ऑडियो_राइट आयात करें

मॉडल = MusicGen.get_pretrained('facebook/musicgen-small') # 300M पैरामीटर
मॉडल.सेट_जेनरेशन_पैराम्स(अवधि=8) # 8 सेकंड का ऑडियो जेनरेट करें

wav = model.generate([ # बैच टेक्स्ट इनपुट
    "सुखदायक पियानो जैज़",
    "रोमांचक इलेक्ट्रॉनिक रॉक"
])

आईडीएक्स के लिए, एन्यूमरेट (डब्ल्यूएवी) में एक_वेव:
    ऑडियो_राइट(f'आउटपुट_{idx}', one_wav.cpu(), model.sample_rate)

पैरामीटर विवरण: MusicGen.get_pretrained() तीन पूर्व निर्धारित आकार स्वीकार करता है: छोटा'` (300M),मध्यम'' (1.5B), `बड़ा'' (3.3B);set_generation_params(अवधि=8, टॉप_k=250, टॉप_p=0.0, तापमान=1.0, cfg_coef=3.0)`cfg_coef पाठ सशर्त अनुसरण की ताकत को नियंत्रित करता है - उच्च मान पाठ विवरण के साथ संगीत से बेहतर मेल खाते हैं, लेकिन विविधता की कीमत पर। पहला रन स्वचालित रूप से मॉडल वजन डाउनलोड करेगा (छोटा लगभग 1.2 जीबी है, बड़ा लगभग 12 जीबी है) और ~/.cache/audiocraft/ में संग्रहीत है।

प्रशिक्षण पोर्टल: संपूर्ण प्रशिक्षण कोड v1.0.0 से शुरू होकर उपलब्ध है। कॉन्फ़िगरेशन सिस्टम (YAML + हाइड्रा) के माध्यम से डेटा सेट, मॉडल आर्किटेक्चर और प्रशिक्षण मापदंडों को परिभाषित करें, और प्रशिक्षण शुरू करने के लिए डोरा रन निष्पादित करें। विस्तृत प्रक्रियाओं के लिए, GitHub रिपॉजिटरी docs/TRAINING.md देखें।

सामुदायिक एक्सटेंशन: हगिंग फेस स्पेस पर दर्जनों ऑडियोक्राफ्ट-आधारित ग्रैडियो डेमो हैं, जिन्हें बिना इंस्टॉलेशन के ब्राउज़र में अनुभव किया जा सकता है; तृतीय-पक्ष डेवलपर्स ने REST API पैकेजिंग डिस्कॉर्ड बॉट और MCP सर्वर एकीकरण में भी योगदान दिया है।

ऑडियोक्राफ्ट उत्पाद मूल्य निर्धारण

ऑडियोक्राफ्ट "फ्री कोड + मॉडल वेट पर गैर-व्यावसायिक प्रतिबंध" की दो-स्तरीय मूल्य निर्धारण संरचना का पालन करता है, जो पारंपरिक अर्थों में "फ्री ओपन सोर्स" के पूरी तरह से समकक्ष नहीं है।

  • सी क्लाइंट/व्यक्तिगत उपयोगकर्ता: कोड और मॉडल वेट निःशुल्क उपलब्ध हैं, और व्यक्तिगत निर्माण, सीखने और अनुसंधान के लिए कोई शुल्क देने की आवश्यकता नहीं है। आधिकारिक डेमो पेज को ऑनलाइन अनुभव किया जा सकता है, और स्थानीय रनिंग के लिए आपके स्वयं के GPU की आवश्यकता होती है।
  • डेवलपर/स्वतंत्र वाणिज्यिक: कोड एमआईटी लाइसेंस के तहत जारी किया गया है। जब तक कॉपीराइट कथन बरकरार रहता है, डेवलपर्स स्वतंत्र रूप से वाणिज्यिक उत्पादों को संशोधित, वितरित और एकीकृत कर सकते हैं। हालाँकि, मॉडल वेट CC-BY-NC 4.0 लाइसेंस का उपयोग करते हैं - किसी भी लाभ के लिए उपयोग (वाणिज्यिक SaaS सेवाओं, विज्ञापन मुद्रीकरण के लिए ऐप एम्बेडिंग और उद्यम के भीतर आंतरिक दक्षता उपकरण सहित) के लिए मेटा से एक अलग प्राधिकरण की आवश्यकता होती है। "ओपन सोर्स कोड और सीमित वजन" की यह पृथक्करण व्यवस्था लागत जाल है जिसके बारे में डेवलपर्स को सबसे अधिक चिंतित होना चाहिए।
  • कॉर्पोरेट/निजी: कोई मानकीकृत मूल्य निर्धारण नहीं। यदि किसी उद्यम को वाणिज्यिक मॉडल भार प्राधिकरण की आवश्यकता है, तो उसे नियमों और शुल्क की पुष्टि के लिए मेटा कानूनी टीम से संपर्क करना होगा। इसके अलावा, उद्यमों को निजीकृत तैनाती के दौरान जीपीयू इंफ्रास्ट्रक्चर पायथन संचालन और रखरखाव पाइपलाइनों और अनुमान एपीआई पैकेजिंग के निर्माण में इंजीनियरिंग निवेश वहन करने की आवश्यकता है।

प्रतिस्पर्धी उत्पादों के साथ कीमत की तुलना: 30-सेकंड की संगीत पीढ़ी के आधार पर, ऑडियोक्राफ्ट (स्व-तैनात) की जीपीयू लागत लगभग $0.01-0.03 है, जबकि साउंडरॉ सदस्यता जैसे समान वाणिज्यिक एपीआई लगभग $16.99/माह (असीमित पीढ़ी लेकिन व्यावसायिक रूप से उपलब्ध नहीं) है, और एआईवीए सदस्यता €15/माह है (व्यावसायिक रूप से उपलब्ध है लेकिन मात्रा प्रतिबंधों के साथ)। एंटरप्राइज़-स्तरीय बैच पीढ़ी परिदृश्यों में ऑडियोक्राफ्ट के महत्वपूर्ण लागत लाभ हैं, लेकिन इसका आधार यह है कि टीम के पास जीपीयू संचालन और रखरखाव क्षमताएं हैं और मॉडल भार के वाणिज्यिक प्राधिकरण को हल कर सकती हैं।

ऑडियोक्राफ्ट एप्लिकेशन परिदृश्य

ऑडियोक्राफ्ट का मुख्य परिदृश्य "बजट-संवेदनशील, उच्च-आवृत्ति परीक्षण और त्रुटि, और कॉपीराइट-आवश्यक ऑडियो सामग्री उत्पादन" के क्षेत्र पर केंद्रित है।

  • लघु वीडियो और सोशल मीडिया साउंडट्रैक: सामग्री निर्माता जल्दी से टिकटॉक, रील्स और यूट्यूब शॉर्ट्स के लिए पृष्ठभूमि संगीत तैयार कर सकते हैं, और एक समय में 15-30 सेकंड की क्लिप तैयार कर सकते हैं। पाठ-संचालित पुनरावृत्तीय परीक्षण और त्रुटि की लागत लगभग शून्य है। राजस्व मात्रा कटौती: एक नियमित लघु वीडियो के लिए साउंडट्रैक चयन समय को "लाइब्रेरी और ऑडिशन ब्राउज़ करने के लिए 10-20 मिनट" से घटाकर "विवरण दर्ज करने के लिए 30 सेकंड + पूर्वावलोकन उत्पन्न करने के लिए 10 सेकंड" कर दिया गया है, और दक्षता 10 गुना से अधिक बढ़ गई है।
  • गेम ध्वनि प्रभाव बड़े पैमाने पर उत्पादन: स्वतंत्र गेम या छोटे स्टूडियो पारंपरिक ध्वनि प्रभाव लाइब्रेरी खरीद या आउटसोर्सिंग अनुकूलन की जगह, पाठ विवरण के आधार पर परिवेशी ध्वनि प्रभाव (हवा की आवाज़, पदयात्रा, दरवाजे की आवाज़) उत्पन्न करने के लिए ऑडियोजेन का उपयोग करते हैं। लाभों की मात्रा कटौती: 50 ध्वनि प्रभावों वाले प्रोजेक्ट के लिए, आउटसोर्सिंग लागत लगभग $500-2000 है। ऑडियोक्राफ्ट का उपयोग करके उत्पादन लागत शून्य के करीब है, लेकिन मैन्युअल स्क्रीनिंग और पोस्ट-प्रोडक्शन फाइन-ट्यूनिंग समय का 10-20% आरक्षित करने की आवश्यकता है।
  • संगीत निर्माण प्रेरणा सहायता: संगीतकार मेलोडी कंडीशनिंग के माध्यम से एक गुनगुनाहट या पियानो क्लिप अपलोड करता है, जिससे मॉडल को सृजन के शुरुआती बिंदु के रूप में कई व्यवस्था विविधताएं उत्पन्न करने की अनुमति मिलती है। यह सीधे तौर पर एक तैयार उत्पाद का उत्पादन नहीं करता है, लेकिन यह रचना बाधा अवधि के दौरान विचार से डेमो तक के समय को काफी कम कर सकता है।
  • पॉडकास्ट और ऑडियो सामग्री पोस्ट-प्रोडक्शन: श्रवण स्तर को समृद्ध करने के लिए संक्रमण ध्वनि प्रभाव, पृष्ठभूमि पैड ध्वनि और पैराग्राफ संक्रमण संगीत उत्पन्न करें। एकल पॉडकास्टरों के लिए विशेष रूप से उपयुक्त - पारंपरिक पोस्ट-प्रोडक्शन में, आपको ध्वनि प्रभाव लाइब्रेरी या आउटसोर्स मिक्सिंग खरीदने की आवश्यकता होती है। ऑडियोक्राफ्ट द्वारा उत्पन्न क्लिप कॉपीराइट-मुक्त हैं और इन्हें सीधे ट्रैक में मिलाया जा सकता है।
  • शिक्षा और अनुसंधान: अकादमिक समुदाय ऑडियो पीढ़ी अनुसंधान के लिए आधारभूत ढांचे के रूप में ऑडियोक्राफ्ट का उपयोग करता है। इसके मॉड्यूलर डिज़ाइन और खुले प्रशिक्षण कोड के कारण, नए मॉडलों के प्रायोगिक सत्यापन की लागत इसे खरोंच से बनाने की तुलना में बहुत कम है।

दृश्यों के लिए उपयुक्त नहीं: ऐसे दृश्य जिनमें अत्यधिक उच्च पीढ़ी सटीकता की आवश्यकता होती है (जैसे कि वाणिज्यिक साउंडट्रैक जिन्हें दूसरे, मूवी-स्तरीय ध्वनि प्रभाव डिजाइन के लिए सटीक लय संरेखण की आवश्यकता होती है जिसके लिए मल्टी-ट्रैक संयोजन नियंत्रण की आवश्यकता होती है) शुद्ध पाठ-संचालित पीढ़ी के तरीकों के लिए उपयुक्त नहीं हैं; ऐसे दृश्यों से भी बचना चाहिए जिनमें चीनी गीतों के सटीक उच्चारण की आवश्यकता होती है, या भाषण संश्लेषण गुणवत्ता के लिए सख्त आवश्यकताओं की आवश्यकता होती है।

ऑडियोक्राफ्ट किसके लिए उपयुक्त है?

ऑडियोक्राफ्ट शोधकर्ताओं से लेकर रचनात्मक श्रमिकों तक विभिन्न प्रकार की भूमिकाओं को कवर करने के लिए एक ओपन सोर्स फ्रेमवर्क का उपयोग करता है, लेकिन प्रत्येक समूह के लिए उपयोग की गहराई और सीमा काफी भिन्न होती है।

  • एआई ऑडियो रिसर्चर: बेसलाइन को तेजी से पुन: पेश कर सकता है, आर्किटेक्चर को संशोधित कर सकता है और प्रशिक्षण कोड और मॉड्यूलर घटकों के आधार पर नए प्रयोग डिजाइन कर सकता है। आवश्यकताएँ: PyTorch गहन शिक्षण के लिए बुनियादी GPU प्रशिक्षण। ऑडियोक्राफ्ट ऑडियो जेनरेशन के क्षेत्र में सबसे ओपन-सोर्स अनुसंधान ढांचे में से एक है।
  • स्वतंत्र डेवलपर्स और पूर्ण-स्टैक इंजीनियर: पायथन अनुमान कोड को एनकैप्सुलेट करके कस्टम एपीआई या वेब एप्लिकेशन बनाएं। पूर्वावश्यकता: पायथन इंजीनियरिंग क्षमताएं जीपीयू सर्वर या क्लाउड इंस्टेंस। 300एम मॉडल एमवीपी सत्यापन का समर्थन करने के लिए पर्याप्त है, और प्रारंभिक चरण में बड़े मॉडल का उपयोग करने की कोई आवश्यकता नहीं है।
  • सामग्री निर्माता और स्व-मीडिया लोग: आधिकारिक डेमो या सामुदायिक ग्रैडियो पृष्ठ के माध्यम से साउंडट्रैक और ध्वनि प्रभाव उत्पन्न करने के लिए MusicGen/AudioGen का उपयोग करें। आवश्यकताएँ: कोई तकनीकी आवश्यकता नहीं, लेकिन एक ब्राउज़र और नेटवर्क की आवश्यकता है। व्यावसायिक परिदृश्यों में, मॉडल वजन अनुमति सीमाओं पर ध्यान दिया जाना चाहिए।
  • छोटे खेल और स्वतंत्र स्टूडियो: कुछ ध्वनि आउटसोर्सिंग कार्य को बदलने के लिए ऑडियोजेन पाइपलाइन का उपयोग करें। पूर्वापेक्षा: टीम में पायथन बेसिक्स वाला एक तकनीकी सदस्य होना सबसे अच्छा है जो मॉडल परिनियोजन और बैच स्क्रिप्ट रखरखाव के लिए जिम्मेदार है।

भीड़ के लिए उपयुक्त नहीं: जिन व्यावसायिक उपयोगकर्ताओं को "शून्य परिनियोजन, आउट-ऑफ-द-बॉक्स उपयोग" (कोई तकनीकी पृष्ठभूमि नहीं है और कमांड लाइन को छूने के इच्छुक नहीं हैं) की सख्त आवश्यकता है, उन्हें वाणिज्यिक एआई संगीत सास को प्राथमिकता देनी चाहिए; जिन मीडिया कंपनियों को बड़े पैमाने पर उत्पादन-स्तर की स्थिरता (24/7 तर्क एसएलए, उद्यम-स्तर तकनीकी सहायता) की आवश्यकता होती है, उनके पास वर्तमान में कोई आधिकारिक चैनल गारंटी नहीं है; जिन परियोजनाओं के लिए चीनी भाषण संश्लेषण या सटीक गीत निर्माण की आवश्यकता होती है, उनके पास ऑडियोक्राफ्ट पारिस्थितिकी तंत्र में कोई परिपक्व समाधान नहीं है।

सारांश और आउटलुक

ऑडियोक्राफ्ट वर्तमान में ओपन सोर्स समुदाय में सबसे संपूर्ण एआई ऑडियो जेनरेशन फ्रेमवर्क है। इसका मूल मूल्य "एकीकृत एनकोडेक टोकन प्रतिनिधित्व परत के माध्यम से समान मॉडल वास्तुकला और प्रशिक्षण पाइपलाइन को साझा करने के लिए संगीत, ध्वनि प्रभाव और संपीड़न कार्यों की अनुमति देना" में निहित है। यह प्रत्येक कार्य के स्वतंत्र मॉडलिंग के पिछले मार्ग से अनिवार्य रूप से भिन्न है।

चार वर्तमान सीमाएँ हैं: पहला, मॉडल-भारित CC-BY-NC 4.0 लाइसेंस व्यावसायीकरण के लिए एक संरचनात्मक बाधा है। समुदाय दो वर्षों से मेटा के खुले वाणिज्यिक लाइसेंस की प्रतीक्षा कर रहा है लेकिन कोई महत्वपूर्ण प्रगति नहीं देखी गई है; दूसरा, मुख्य भंडार की रखरखाव गतिविधि लगभग स्थिर हो गई है - v1.4.0 बिना किसी अनुवर्ती आधिकारिक संस्करण के 18 महीने से अधिक समय तक अल्फा चरण में रहा है; तीसरा, लघु क्लिप (15 सेकंड के भीतर) में पीढ़ी की गुणवत्ता उत्कृष्ट है, लेकिन 30 से अधिक है विषय की सुसंगतता और संरचना की भावना सेकंड में महत्वपूर्ण रूप से क्षीण हो जाती है; चौथा, गैर-अंग्रेजी पाठ स्थितियों (विशेष रूप से चीनी) की अर्थ संबंधी निम्नलिखित क्षमता अंग्रेजी की तुलना में काफी कमजोर है, और चीनी उपयोगकर्ताओं को अतिरिक्त शीघ्र इंजीनियरिंग ट्यूनिंग की आवश्यकता होती है।

अनुवर्ती अवलोकन बिंदु: क्या मेटा लामा श्रृंखला के भविष्य के ऑडियो एक्सटेंशन में ऑडियोक्राफ्ट की अद्यतन लय को फिर से सक्रिय करेगा; क्या समुदाय-व्युत्पन्न मॉडल (जैसे कि म्यूजिकजेन फाइन-ट्यूनिंग पर आधारित चीनी संगीत मॉडल) लंबी-पूंछ वाली जरूरतों को पूरा कर सकते हैं जो आधिकारिक तौर पर कवर नहीं की गई हैं; और क्या हगिंग फेस इकोसिस्टम में ऑडियोक्राफ्ट का स्पेस एप्लिकेशन लगातार बढ़ रहा है।

खरीद/गोद लेने का जोखिम मूल्यांकन: स्वतंत्र सामग्री निर्माता और सीमित बजट वाले छोटे गेम स्टूडियो आंतरिक परीक्षण और त्रुटि और प्रोटोटाइप सत्यापन के लिए 300M मॉडल का उपयोग करने को प्राथमिकता दे सकते हैं, शून्य लागत पर और कानूनी जोखिमों के बिना (गैर-व्यावसायिक उपयोग)। उद्यम-स्तरीय खरीद से पहले तीन सत्यापन कार्य पूरे किए जाने चाहिए: (1) मॉडल वजन वाणिज्यिक प्राधिकरण शर्तों और शुल्क की पुष्टि के लिए मेटा लीगल से संपर्क करें; (2) आकलन करें कि क्या जीपीयू बुनियादी ढांचे और संचालन और रखरखाव टीम की क्षमताएं दीर्घकालिक अनुमान पाइपलाइनों का समर्थन कर सकती हैं; (3) अपस्ट्रीम वेयरहाउस गतिविधि निगरानी स्थापित करें - यदि v1.4.0 ने 12 महीनों के भीतर स्थिर संस्करण में प्रवेश नहीं किया है, तो आपको विकल्प तैयार करने पर विचार करना चाहिए (जैसे सामुदायिक फाइन-ट्यूनिंग मॉडल या हगिंग फेस पर वाणिज्यिक एपीआई)। वर्तमान में सबसे विश्वसनीय रणनीति "प्रोटोटाइप सत्यापन के लिए खुले स्रोत और उत्पादन विस्तार के लिए वाणिज्यिक एपीआई का उपयोग करना" की दोहरी ट्रैक समानता है।

संबंधित उपकरण: elevenlabs, udio

संस्करण जानकारी

  • ऑडियोक्राफ्ट 1.2 :MusicGen लंबी ऑडियो पीढ़ी की गुणवत्ता को अनुकूलित करें, और एक नया मॉडल आसवन संस्करण (छोटा आकार, तेज़ अनुमान) जोड़ें।
  • ऑडियोक्राफ्ट 1.0 :प्रारंभिक ओपन सोर्स रिलीज़, जिसमें MusicGen, AudioGen और EnCodec कोर मॉडल शामिल हैं।

उपयोगकर्ता समीक्षाएं

  • समीक्षाएं लोड हो रही हैं...