डेटाहेराल्ड
मुफ्त
डेटाहेराल्ड SQL AI रूपांतरण इंजन के लिए एक एंटरप्राइज़-स्तरीय प्राकृतिक भाषा है जो गैर-तकनीकी उपयोगकर्ताओं को SQL स्टेटमेंट लिखे बिना बातचीत के माध्यम से सीधे डेटाबेस से क्वेरी करने की अनुमति देता है।
डेटाहेराल्ड
डेटाहेराल्ड के मुख्य पैरामीटर और आँकड़े
डेटाहेराल्ड को आधिकारिक तौर पर SQL रूपांतरण इंजन के लिए एंटरप्राइज़-स्तरीय प्राकृतिक भाषा के रूप में तैनात किया गया है। इसका मुख्य मूल्य गैर-तकनीकी उपयोगकर्ताओं को डेटा टीम को SQL स्टेटमेंट लिखने की आवश्यकता के बिना, दैनिक वार्तालापों के माध्यम से सीधे रिलेशनल डेटाबेस को क्वेरी करने की अनुमति देना है। इसके और पारंपरिक बीआई टूल के बीच मूलभूत अंतर यह है कि यह प्रीसेट डैशबोर्ड या निश्चित रिपोर्ट टेम्पलेट्स पर निर्भर नहीं है, बल्कि वास्तविक समय में उपयोगकर्ता के इरादों का विश्लेषण करता है और गतिशील रूप से क्वेरी स्टेटमेंट उत्पन्न करता है, और आवश्यकताओं को धीरे-धीरे परिष्कृत करने के लिए कई दौर के संवाद का समर्थन करता है।
| प्रोजेक्ट्स | सार्वजनिक सूचना |
|---|---|
| आधिकारिक स्थिति | एंटरप्राइज़-ग्रेड प्राकृतिक भाषा से SQL इंजन |
| मुख्य क्षमताएं | NL2SQL, मल्टी-राउंड संवाद संदर्भ, जटिल SQL पीढ़ी (जॉइन/सबक्वेरी/एकत्रीकरण/विंडो फ़ंक्शन) |
| समर्थित डेटाबेस | PostgreSQL, MySQL, BigQuery, स्नोफ्लेक, डेटाब्रिक्स, MS SQL सर्वर, ClickHouse, MariaDB, Redshift |
| वेक्टर भंडारण | पाइनकोन, एस्ट्रा, क्रोमा |
| परिनियोजन विधि | सेल्फ-होस्टिंग (डॉकर कंपोज़), क्लाउड होस्टिंग (एंटरप्राइज़ एडिशन) |
| इनपुट विधि | प्राकृतिक भाषा (मुख्यतः अंग्रेजी) |
| आउटपुट स्वरूप | SQL कथन + क्वेरी परिणाम + CSV निर्यात |
| ओपन सोर्स लाइसेंस | अपाचे-2.0 |
| गिटहब स्टार्स | ~3,600 |
| गिटहब फोर्क्स | ~264 |
| कोड योगदानकर्ता | 19 |
| नवीनतम संस्करण | v1.0.3 (2024-04-30, गिटहब रिलीज़) |
| कुल रिलीज़ | 9 संस्करण |
| मुख्य भाषाएँ | पायथन (58.5%), टाइपस्क्रिप्ट (39.3%) |
| सिस्टम घटक | इंजन, एंटरप्राइज एपीआई, एडमिन कंसोल, स्लैकबॉट |
परिनियोजन आर्किटेक्चर: डेटाहेराल्ड एक माइक्रोसर्विस आर्किटेक्चर को अपनाता है, जिसमें चार स्वतंत्र घटक शामिल हैं: इंजन (कोर एनएल2एसक्यूएल इंजन), एंटरप्राइज़ (उपयोगकर्ता/संगठन/प्रमाणीकरण प्रबंधन), एडमिन कंसोल (प्रबंधन इंटरफ़ेस) और स्लैकबॉट (स्लैक एकीकरण)। प्रत्येक घटक को डॉकर कंपोज़ के माध्यम से समान रूप से व्यवस्थित किया जाता है, जो मांग पर विभाजित तैनाती का समर्थन करता है।
डेटाबेस कवरेज की चौड़ाई: v0.0.1 से v1.0.3 तक, डेटाहेराल्ड ने धीरे-धीरे 9 प्रकार के रिलेशनल डेटाबेस और 3 प्रकार के वेक्टर स्टोरेज को एकीकृत किया है, जो मुख्यधारा OLTP (MySQL, PostgreSQL, SQL सर्वर), OLAP (क्लिकहाउस, रेडशिफ्ट) और क्लाउड डेटा वेयरहाउस (बिगक्वेरी, स्नोफ्लेक, डेटाब्रिक्स) को कवर करता है। यह NL2SQL समाधान से इसका मुख्य अंतर है जो केवल एक प्रकार के डेटाबेस का समर्थन करता है।
पुनरावृत्ति लय: पहली सार्वजनिक रिलीज़ v0.0.1 (2023-08), v1.0.0 (2024-01), v1.0.3 (2024-04), जिसके बाद GitHub प्रतिबद्ध आवृत्ति में काफी गिरावट आई और वर्तमान में रखरखाव अवधि में है। चयन करते समय, आपको सामुदायिक गतिविधि और दीर्घकालिक समर्थन जोखिमों का मूल्यांकन करने की आवश्यकता है।
डेटाहेराल्ड के उपयोगकर्ता और बाज़ार की पहचान
डेटाहेराल्ड की बाज़ार पहचान मुख्य रूप से ओपन सोर्स सामुदायिक प्रतिक्रिया और एंटरप्राइज़ पीओसी सत्यापन में परिलक्षित होती है। अधिकारी ने विशिष्ट राजस्व डेटा, भुगतान करने वाले ग्राहकों की संख्या या एसएलए प्रतिबद्धता विवरण का खुलासा नहीं किया है।
गिटहब समुदाय की लोकप्रियता: 3,600+ सितारे और 264 फ़ोर्क, जो NL2SQL ओपन सोर्स ट्रैक में ऊपरी-मध्य स्तर पर है। समान परियोजनाओं की तुलना: SQLChat में लगभग 4k सितारे हैं, Vanna में लगभग 12k सितारे हैं, और DB-GPT में लगभग 14k सितारे हैं। डेटाहेराल्ड को चार घटकों (इंजन + एंटरप्राइज + एडमिन कंसोल + स्लैकबॉट) का एक पूरा सेट प्रदान करने की विशेषता है, जो केवल कोर इंट्रेंस इंजन प्रदान करने वाली अधिकांश परियोजनाओं की तुलना में एंटरप्राइज़-स्तरीय डिलीवरी फॉर्म के करीब है।
एंटरप्राइज़ सत्यापन परिदृश्य: आधिकारिक दस्तावेज़ीकरण और GitHub README में हाइलाइट किए गए विशिष्ट उपयोग के मामलों में SaaS के भीतर एम्बेडेड Q&A क्षमताएं, स्लैक पर आधारित प्राकृतिक भाषा गिनती रोबोट और व्यावसायिक टीमों के लिए स्वयं-सेवा गिनती पोर्टल शामिल हैं। ये उपयोग के मामले मध्यम और बड़े उद्यमों के लिए लक्षित हैं जिन्होंने डेटा वेयरहाउस में निवेश किया है लेकिन छोटी और सूक्ष्म टीमों के बजाय विश्लेषणात्मक जनशक्ति की कमी है।
पारिस्थितिकी सहयोग: परियोजना अवलोकन के लिए लैंगस्मिथ को एकीकृत करती है, स्कीमा संदर्भ भंडारण के रूप में पाइनकोन/एस्ट्रा/क्रोमा तीन वेक्टर डेटाबेस का समर्थन करती है, और मुख्यधारा एलएलएम सेवाओं (ओपनएआई जीपीटी श्रृंखला एंथ्रोपिक क्लाउड, स्व-होस्टेड मॉडल) के साथ जोड़ा जा सकता है। इससे पता चलता है कि इसे मॉडल-अज्ञेयवादी बने रहने और किसी एक एआई विक्रेता से बंधे नहीं रहने के लिए डिज़ाइन किया गया है।
अपनाने की शर्तें: डेटाहेराल्ड के वास्तविक मूल्य रिलीज के लिए आवश्यक है कि उद्यम के पास पहले से ही ① संरचित संबंधपरक डेटा संपत्तियां हों, ② स्पष्ट स्कीमा दस्तावेज़ या गोल्डन क्वेरी नमूने (गोल्डन एसक्यूएल), और ③ आईटी टीमें अतिरिक्त स्व-होस्ट किए गए बुनियादी ढांचे को बनाए रखने के लिए तैयार हों। उनमें से किसी एक के बिना, लैंडिंग प्रभाव काफी कम हो जाएगा।
डेटाहेराल्ड के लागत लाभ
डेटाहेराल्ड की लागत संरचना को "सी-साइड/व्यक्तिगत उपयोगकर्ता", "एपीआई/डेवलपर एकीकरण", और "उद्यम/निजी तैनाती" के तीन स्तरों से अलग से जांचने की आवश्यकता है।
सी ग्राहक/व्यक्तिगत उपयोगकर्ता:
- स्पष्ट लागत: खुला स्रोत समुदाय संस्करण पूरी तरह से मुफ़्त है, और Apache-2.0 लाइसेंस मनमाने ढंग से उपयोग, संशोधन और पुनर्वितरण की अनुमति देता है। व्यक्तिगत डेवलपर्स को केवल अपने स्वयं के सर्वर की परिचालन लागत (डॉकर कंपोज़ मोड में 4 कंटेनर चलाना, और अनुमानित न्यूनतम कॉन्फ़िगरेशन 4 कोर और 8 जी मेमोरी है) वहन करने की आवश्यकता है।
- छिपी हुई लागत: आपको एलएलएम एपीआई कुंजी (जैसे ओपनएआई, एंथ्रोपिक) को स्वयं कॉन्फ़िगर करने की आवश्यकता है, और एलएलएम कॉल शुल्क का बिल टोकन द्वारा किया जाता है। स्कीमा स्कैनिंग + एसक्यूएल जेनरेशन सहित एक सामान्य क्वेरी में लगभग 2,000-8,000 टोकन की खपत होती है, जो क्वेरी जटिलता के साथ बढ़ती है। लगातार कॉल वाले परिदृश्यों में, एलएलएम एपीआई ओवरहेड बुनियादी ढांचे की लागत से तेजी से अधिक हो सकता है।
एपीआई/डेवलपर एकीकरण:
- REST API लेयर: इंजन और एंटरप्राइज़ घटकों के ओपन सोर्स संस्करण एक संपूर्ण RESTful API (प्रॉम्प्ट, sql-जेनरेशन, nl-जेनरेशन, फ़ाइनट्यूनिंग और अन्य एंडपॉइंट सहित) प्रदान करते हैं, जिसे डेवलपर्स अपने स्वयं के एप्लिकेशन में निःशुल्क एकीकृत कर सकते हैं।
- ट्यूनिंग लागत: डेटाहेराल्ड गोल्डन एसक्यूएल पर आधारित फाइन-ट्यूनिंग (फाइनट्यूनिंग) का समर्थन करता है, लेकिन फाइन-ट्यूनिंग प्रक्रिया ओपनएआई प्रशिक्षण क्रेडिट का उपभोग करती है और उच्च गुणवत्ता वाले प्रश्न-एसक्यूएल युग्मित नमूनों की तैयारी की आवश्यकता होती है। नमूनों की अनुशंसित संख्या 50-200 है, और एक फाइन-ट्यूनिंग की लागत दसियों डॉलर के ऑर्डर पर है।
- अंतर्निहित एकीकरण लागत: आपको प्रत्येक डेटाबेस कनेक्शन के लिए स्कीमा विवरण को मैन्युअल रूप से कॉन्फ़िगर करना होगा (या एक स्वचालित स्कैन चलाना होगा), गोल्डन एसक्यूएल नमूना लाइब्रेरी को बनाए रखना होगा, और छिपे हुए तर्क से निपटना होगा कि एलएलएम-जनरेटेड एसक्यूएल अपेक्षाओं को पूरा नहीं करता है। ये इंजीनियरिंग प्रयास अक्सर एपीआई कॉल की लागत से अधिक होते हैं।
उद्यम/निजी तैनाती:
- एंटरप्राइज़ संस्करण मूल्य निर्धारण: एंटरप्राइज़ संस्करण की आधिकारिक कीमत का खुलासा नहीं किया गया है। उद्योग अभ्यास के अनुसार, यह अनुमान लगाया जाता है कि एक सदस्यता प्रणाली अपनाई गई है। बिलिंग आयामों में आमतौर पर शामिल होते हैं: डेटाबेस कनेक्शन की संख्या, एपीआई कॉल कोटा और उपयोगकर्ता सीट एसएलए स्तर। एंटरप्राइज़ संस्करण के अतिरिक्त मूल्य में एसएसओ एकीकरण, ऑडिट लॉगिंग और समर्पित एसएलए समर्थन शामिल है।
- बुनियादी ढांचे की लागत: निजी तैनाती के लिए एंटरप्राइज़ को बाध्य MongoDB डेटाबेस, वेक्टर डेटाबेस और नेटवर्क कॉन्फ़िगरेशन को चलाने के लिए डॉकर को प्रबंधित करने की आवश्यकता होती है। प्रति दिन 1,000 प्रश्नों के मध्यम लोड पर, मासिक बुनियादी ढांचे की लागत 100-500 अमेरिकी डॉलर (क्लाउड होस्ट + वेक्टर स्टोरेज + बैंडविड्थ) होने का अनुमान है।
- मानव संचालन और रखरखाव लागत: डॉकर और एलएलएम कॉल से परिचित कम से कम एक विकास या संचालन और रखरखाव कर्मी को सिस्टम रखरखाव, गोल्डन एसक्यूएल प्रबंधन और क्वेरी गुणवत्ता निगरानी के लिए जिम्मेदार होना आवश्यक है। यह छिपी हुई लागत आम तौर पर बुनियादी ढांचे की लागत का 3-5 गुना है।
लागत तुलना: NL2SQL खुला स्रोत समाधान
| समाधान | ओपन सोर्स लाइसेंस | परिनियोजन जटिलता | डेटाबेस कवरेज | फ़ाइन-ट्यूनिंग समर्थन | उद्यम सुविधाएँ | सामुदायिक गतिविधि |
|---|---|---|---|---|---|---|
| डाटाहेराल्ड | अपाचे-2.0 | मध्यम (4 घटक डॉकर) | 9 प्रकार के डीबी + 3 प्रकार के वेक्टर स्टोरेज | ✅ बिल्ट-इन फाइनट्यूनिंग एपीआई | ✅ एडमिन कंसोल + स्लैकबॉट + एंटरप्राइज | मध्यम (3.6 हजार सितारे) |
| वन्ना | एमआईटी | लो (पायथन लाइब्रेरी) | मुख्य रूप से SQLite/PG | का समर्थन करता है ✅डीडीएल दस्तावेजों के माध्यम से प्रशिक्षित | ❌ कोई नहीं | उच्च (12 हजार सितारे) |
| एसक्यूएलचैट | एमआईटी | निम्न (नोड लाइब्रेरी) | मुख्य रूप से MySQL/PG | का समर्थन करता है ❌ कोई नहीं | ❌ कोई नहीं | मध्यम (4k सितारे) |
| डीबी-जीपीटी | अपाचे-2.0 | उच्च (एकाधिक घटक) | एकाधिक डीबी | ✅ समर्थन | ✅ पूर्ण उद्यम सुविधाएँ | उच्च (14 हजार सितारे) |
लागत अंतर की मुख्य बातें:
- डेटाहेराल्ड ओपन सोर्स एनएल2एसक्यूएल सॉल्यूशन (एडमिन कंसोल स्लैक इंटीग्रेशन, मल्टी-टेनेंसी, ऑडिट लॉग रेडी) में सबसे संपूर्ण एंटरप्राइज़-स्तरीय पैकेज प्रदान करता है, जो उन टीमों के लिए उपयुक्त है जिन्हें स्क्रैच से निर्माण के बजाय "आउट-ऑफ़-द-बॉक्स" की आवश्यकता होती है।
- यदि आपके पास पहले से ही एलएलएम एपीआई क्रेडिट है और तैनाती जटिलता के लिए कम सहनशीलता है, तो वन्ना (एकल पायथन लाइब्रेरी इंस्टॉलेशन) या एसक्यूएलचैट (नोड.जेएस पैकेज) की प्रारंभिक स्टार्टअप लागत कम है।
- डीबी-जीपीटी कार्यात्मक पूर्णता और सामुदायिक पैमाने के मामले में अग्रणी है, लेकिन इसकी तैनाती जटिलता भी अधिक है, और यह मुख्य रूप से चीनी परिदृश्यों के लिए अनुकूलित है, जो डेटाहेराल्ड की अंग्रेजी-पहली स्थिति से अलग है।
डेटाहेराल्ड के मुख्य कार्य
-
प्राकृतिक भाषा से SQL (NL2SQL): "अंतिम तिमाही में क्षेत्र के अनुसार बिक्री रैंकिंग" दर्ज करें, इंजन स्वचालित रूप से एकत्रीकरण इरादे को पहचानता है और GROUP BY और ORDER BY के साथ SQL कथन उत्पन्न करता है। मुख्य तंत्र एलएलएम के माध्यम से उपयोगकर्ता प्रश्नों को डेटाबेस स्कीमा में मैप करना है, और फिर निष्पादन योग्य एसक्यूएल को संश्लेषित करने के लिए वार्तालाप संदर्भ को संयोजित करना है। पारंपरिक बीआई टूल से अंतर यह है कि इसमें कोई पूर्व निर्धारित रिपोर्ट संरचना नहीं है और उपयोगकर्ता किसी भी क्वेरी आयाम का स्वतंत्र रूप से वर्णन कर सकते हैं।
-
संवाद संदर्भ संरक्षण के कई दौर: पहले क्वेरी परिणाम के आधार पर प्रश्न पूछना जारी रखें (जैसे कि "केवल पूर्वी चीन देखें" या "माह के अनुसार प्रदर्शित करने के लिए बदलें")। इंजन प्री-ऑर्डर SQL की फ़िल्टर स्थितियों और एकत्रीकरण तर्क को बरकरार रखता है, और केवल WHERE क्लॉज या GROUP BY फ़ील्ड को क्रमिक रूप से संशोधित करता है। व्यावसायिक उपयोगकर्ताओं के लिए इसका वास्तविक मूल्य यह है कि एक बार में पूरी आवश्यकताओं का वर्णन करने की आवश्यकता नहीं है, और क्वेरी का दायरा मानव के साथ बातचीत की तरह धीरे-धीरे कम किया जा सकता है। एकल विश्लेषण कार्य के इंटरैक्टिव दौर को आम तौर पर 1 दौर से 3-5 दौर तक बढ़ाया जाता है, लेकिन प्रत्येक दौर शब्दार्थ रूप से सुसंगत रहता है।
-
डेटाबेस स्कीमा स्वचालित जागरूकता: इंजन स्वचालित रूप से डेटाबेस तालिका संरचना, फ़ील्ड नाम, फ़ील्ड प्रकार, प्राथमिक और विदेशी कुंजी संबंधों को स्कैन करता है, और SQL उत्पन्न करते समय स्वचालित रूप से फ़ील्ड उपनाम और संबंधित कुंजी से मेल खाता है। स्कीमा स्कैन परिणाम MongoDB और वेक्टर डेटाबेस में संग्रहीत होते हैं। एसक्यूएल उत्पन्न करते समय, एलएलएम केवल संदर्भ के रूप में उपयोगकर्ता के प्रश्नों से संबंधित तालिकाओं और फ़ील्ड को पुनः प्राप्त करता है, जिससे संपूर्ण स्कीमा को प्रॉम्प्ट में भरने और टोकन विस्तार का कारण बनने से बचाया जा सकता है।
-
क्वेरी परिणामों की प्राकृतिक भाषा में व्याख्या (एनएल जेनरेशन): उत्पन्न एसक्यूएल स्टेटमेंट और निष्पादन परिणामों के लिए, इंजन स्वचालित रूप से प्राकृतिक भाषा में स्पष्टीकरण उत्पन्न करता है ताकि यह समझाया जा सके कि "इस एसक्यूएल के लिए क्या फ़िल्टरिंग की गई थी, किन आयामों को एकत्रित किया गया था, और सॉर्टिंग का आधार क्या है"। गैर-तकनीकी उपयोगकर्ताओं के लिए इस सुविधा का मुख्य मूल्य यह है कि भले ही वे एसक्यूएल को नहीं समझ सकते हैं, वे समझ सकते हैं कि क्वेरी तर्क सही है या नहीं, जिससे एआई द्वारा उत्पन्न परिणामों में विश्वास स्थापित होता है।
-
गोल्डन एसक्यूएल प्रबंधन और मॉडल फाइन-ट्यूनिंग: गोल्डन एसक्यूएल संग्रह में सत्यापित "प्रश्न-एसक्यूएल" जोड़े को संग्रहीत करने का समर्थन करता है, और इन नमूनों के आधार पर स्वचालित रूप से जीपीटी श्रृंखला मॉडल को फाइन-ट्यूनिंग (फाइनट्यूनिंग) करता है। समान व्यावसायिक प्रश्नों पर सुव्यवस्थित मॉडल की सटीकता में काफी सुधार हुआ है। यह एक "जितना अधिक आप इसका उपयोग करेंगे उतना अधिक सटीक" तंत्र है: प्रारंभिक चरण में, यह सामान्य एलएलएम के ज्ञान पर निर्भर करता है, और जैसे-जैसे कंपनी मालिकाना क्वेरी नमूने जमा करती है, सटीकता धीरे-धीरे 90%+ तक पहुंच जाती है।
-
मध्यवर्ती चरण विज़ुअलाइज़ेशन (स्ट्रीमिंग): v1.0.2 में पेश किया गया स्ट्रीमिंग एंडपॉइंट SQL पीढ़ी के मध्यवर्ती तर्क चरणों को दिखाता है - स्कीमा पुनर्प्राप्ति से SQL संश्लेषण से परिणाम निष्पादन तक - उपयोगकर्ताओं और डेवलपर्स को AI सोच श्रृंखला देखने की अनुमति देता है, जिससे डिबगिंग और विश्वास निर्माण की सुविधा मिलती है।
-
स्लैक इंटीग्रेटेड क्वेरी रोबोट: स्लैकबॉट घटक के माध्यम से, उपयोगकर्ता स्लैक चैनल में डेटाबेस से प्रश्न पूछने के लिए सीधे प्राकृतिक भाषा का उपयोग कर सकते हैं, और रोबोट क्वेरी परिणाम या सीएसवी फ़ाइलें लौटाता है। यह तकनीकी पृष्ठभूमि के बिना संचालन, विपणन और बिक्री टीमों के लिए विशेष रूप से उपयोगी है: दैनिक वर्कफ़्लो में डेटा अधिग्रहण को पूरा करने के लिए किसी भी बीआई उपकरण को खोलने की आवश्यकता नहीं है।
-
सीएसवी निर्यात और फ़ाइल भंडारण: क्वेरी परिणाम सीधे सीएसवी में निर्यात किए जा सकते हैं और एस3 में संग्रहीत किए जा सकते हैं (एडब्ल्यूएस क्रेडेंशियल कॉन्फ़िगर करके), जो एक्सेल या Google शीट्स में बाद के माध्यमिक विश्लेषण के लिए उपयुक्त है। एपीआई प्रतिक्रिया पेलोड को बहुत बड़ा होने से रोकने के लिए संख्या 50 लाइनों से अधिक होने पर स्वचालित रूप से फ़ाइल भंडारण का उपयोग करें।
डेटाहेराल्ड का मॉडल और संस्करण विकास
डेटाहेराल्ड का संस्करण इतिहास स्पष्ट रूप से प्रोटोटाइप सत्यापन से लेकर उद्यम कार्यक्षमता में सुधार से लेकर पारिस्थितिक विस्तार तक के विकास पथ को दर्शाता है। निम्नलिखित को GitHub द्वारा जारी सार्वजनिक जानकारी के आधार पर संकलित किया गया है।
मेनलाइन रिलीज़
| संस्करण | रिलीज की तारीख | मुख्य परिवर्तन | मील के पत्थर |
|---|---|---|---|
| v0.0.1 | 2023-08 | प्रारंभिक संस्करण, मूल NL2SQL क्वेरी फ़ंक्शन | परियोजना अनुमोदन, एमवीपी सत्यापन |
| v0.0.2 | 2023-09-14 | रेस्टफुल एंडपॉइंट पुनर्निर्माण, MongoDB संग्रह नाम मानकीकरण, db_connection_id एसोसिएशन का परिचय | एपीआई संरचना को अंतिम रूप देना, तेजी से प्रोटोटाइप से मानकीकरण की ओर बढ़ना |
| v0.0.3 | 2023-09-26 | एलएलएम क्रेडेंशियल्स एसएसएच कनेक्शन अनुकूलन और एसिंक्रोनस स्कीमा स्कैनिंग का समर्थन करता है एंटरप्राइज़ कनेक्शन क्षमताओं को बढ़ाया गया है और स्कैनिंग प्रदर्शन को अनुकूलित किया गया है | |
| v0.0.4 | 2023-10-07 | समापन बिंदु का नाम बदलें ऑब्जेक्ट आईडी विदेशी कुंजी एनएल पीढ़ी विभाजन | एपीआई शब्दार्थ स्पष्ट, 1.0 के लिए तैयारी करें |
| v0.0.5 | 2023-10-26 | llm_api_key फ़ील्ड सरलीकृत S3 CSV संग्रहण, त्रुटि कोड प्रणाली | सरलीकृत विन्यास और बेहतर अवलोकनशीलता |
| v0.0.6 | 2023-11-14 | CSV जनरेशन फ़्लैग S3 प्रमाणपत्र कॉन्फ़िगर करने योग्य | बेहतर डेटा निर्यात क्षमताएं |
| v1.0.0 | 2024-01-17 | फाइनट्यूनिंग एपीआई, प्रॉम्प्ट/एसक्यूएल-जेनरेशन/एनएल-जेनरेशन तीन-चरण विभाजन गोल्डन एसक्यूएल संग्रह | वास्तुकला परिपक्वता मील का पत्थर |
| v1.0.1 | 2024-03-05 | ClickHouse MariaDB आधिकारिक समर्थन, रिफ्रेश एंडपॉइंट, त्रुटि कोड परिशोधन का समर्थन करता है डेटाबेस कवरेज विस्तार | |
| v1.0.2 | 2024-04-04 | एमएस एसक्यूएल सर्वर, एस्ट्रा/पाइनकोन सर्वर रहित समर्थन स्ट्रीमिंग मध्यवर्ती चरण लैंगस्मिथ एकीकरण | पारिस्थितिक संबंध और अवलोकनीयता में वृद्धि |
| v1.0.3 | 2024-04-30 | रेडशिफ्ट सपोर्ट, मल्टीपल स्कीमा सपोर्ट (पीजी/बिगक्वेरी/स्नोफ्लेक/डेटाब्रिक्स) | नवीनतम संस्करण, एंटरप्राइज़ मल्टी-स्कीमा परिदृश्यों के लिए बिल्कुल उपयुक्त |
विकासवादी संदर्भ की व्याख्या
चरण 1: प्रोटोटाइप सत्यापन (v0.0.1-v0.0.2): पहले दो संस्करणों ने मुख्य रूप से "प्राकृतिक भाषा से SQL तक" की एंड-टू-एंड प्रक्रिया पूरी की। V0.0.2 में RESTful API रीफैक्टरिंग सभी बाद की एंटरप्राइज़ सुविधाओं की नींव रखती है।
चरण 2: एंटरप्राइज कनेक्शन क्षमता निर्माण (v0.0.3-v0.0.6): धीरे-धीरे पूरा एसएसएच कनेक्शन, एस3 स्टोरेज में सीएसवी निर्यात का समर्थन करने वाले कई डेटाबेस, त्रुटि कोड सिस्टम और अन्य एंटरप्राइज़-आवश्यक लेकिन गैर-कोर एआई क्षमताएं। इस चरण से पता चलता है कि डेटाहेराल्ड टीम को एहसास है कि उद्यमों में एनएल2एसक्यूएल के कार्यान्वयन में बाधा न केवल एआई सटीकता है, बल्कि डेटा कनेक्टिविटी और संचालन और रखरखाव अवलोकन भी है।
चरण तीन: 1.0 आर्किटेक्चर परिपक्वता (v1.0.0): v1.0.0 एक प्रमुख वास्तुशिल्प परिवर्तन है जो मूल एकल "प्रश्न → उत्तर" प्रक्रिया को तीन-चरण पाइपलाइन में विभाजित करता है - प्रॉम्प्ट (समस्या समझ) → एसक्यूएल जेनरेशन (एसक्यूएल संश्लेषण) → एनएल जेनरेशन (परिणाम व्याख्या), और फाइनट्यूनिंग एपीआई पेश करता है। तीन-चरणीय विभाजन प्रत्येक अनुभाग को स्वतंत्र रूप से अनुकूलित, कैश्ड और स्वतंत्र रूप से ऑडिट करने की अनुमति देता है, जो एंटरप्राइज़-स्तरीय परिनियोजन के लिए एक महत्वपूर्ण डिज़ाइन निर्णय है।
चरण 4: पारिस्थितिक विस्तार और रखरखाव (v1.0.1-v1.0.3): स्ट्रीमिंग एंडपॉइंट के माध्यम से अवलोकन में सुधार करते हुए डेटाबेस कवरेज (क्लिकहाउस, मारियाडीबी, एसक्यूएल सर्वर, रेडशिफ्ट) और वेक्टर स्टोरेज विकल्प (एस्ट्रा, पाइनकोन सर्वर रहित) के विस्तार पर ध्यान दें। v1.0.3 के बाद, परियोजना ने कम-सक्रिय रखरखाव अवधि में प्रवेश किया, और कोई नया फीचर संस्करण जारी नहीं किया गया।
उम्मीदवार सत्यापन और सामुदायिक योगदान
मेनलाइन रिलीज़ के अलावा, डेटाहेराल्ड पुल अनुरोधों और मुद्दों के माध्यम से 19 योगदानकर्ताओं की भागीदारी को बढ़ाता है, जिसमें बग फिक्स, दस्तावेज़ीकरण सुधार और मामूली सुविधा संवर्द्धन शामिल हैं। लेकिन कुल मिलाकर, परियोजना का मुख्य विकास आंतरिक रूप से टीम द्वारा किया जाता है, और सामुदायिक योगदानकर्ता मुख्य रूप से दस्तावेज़ीकरण और सीमांत कार्यों पर ध्यान केंद्रित करते हैं।
संस्करण रणनीति मूल्यांकन: डेटाहेराल्ड का संस्करण नामकरण सिमेंटिक संस्करण विनिर्देश (सेमवीर) का पालन करता है, लेकिन v0.0.1 से v1.0.3 तक केवल 8 महीने लगे, और फिर स्थिर हो गया। चयन करते समय, आपको मूल्यांकन करने की आवश्यकता है: क्या वर्तमान कार्य आवश्यकताओं को पूरा करते हैं, और क्या आप सामुदायिक कांटा या स्व-रखरखाव के जोखिम को स्वीकार करने को तैयार हैं।
डेटाहेराल्ड के तकनीकी लाभ
डेटाहेराल्ड का तकनीकी लाभ एकल एल्गोरिदम की सफलता में नहीं है, बल्कि इंजीनियरिंग आर्किटेक्चर डिज़ाइन में निहित है - एलएलएम की एनएल2एसक्यूएल क्षमताओं को एक एंटरप्राइज़-स्तरीय सिस्टम में कैसे समाहित किया जाए जिसे कार्यान्वित किया जा सके, अवलोकन योग्य और पुनरावृत्त किया जा सके।
तीन चरण वाली पाइपलाइन वास्तुकला
डेटाहेराल्ड प्राकृतिक भाषा क्वेरी प्रोसेसिंग को तीन स्वतंत्र चरणों में विभाजित करता है:
उपयोगकर्ता इनपुट → [प्रॉम्प्ट] → [एसक्यूएल जेनरेशन] → [एनएल जेनरेशन] → यूजर आउटपुट
↓ ↓
स्कीमा वेक्टर पुनर्प्राप्ति गोल्डन एसक्यूएल मिलान
- प्रॉम्प्ट चरण: उपयोगकर्ता की प्राकृतिक भाषा इनपुट प्राप्त करें, वेक्टर डेटाबेस से प्राप्त वार्तालाप इतिहास (यदि कोई हो) और प्रासंगिक स्कीमा जानकारी को संयोजित करें, और इसे एलएलएम-अनुकूल प्रॉम्प्ट में इकट्ठा करें। मुख्य अनुकूलन यह है: संपूर्ण डेटाबेस स्कीमा को एक बार में इंजेक्ट करने के बजाय, केवल उपयोगकर्ता की समस्या के लिए सबसे अधिक प्रासंगिक तालिकाओं और फ़ील्ड को वेक्टर समानता पुनर्प्राप्ति के माध्यम से चुना जाता है, जो टोकन की खपत को बहुत कम करता है और एलएलएम की व्याकुलता को कम करता है।
- एसक्यूएल जेनरेशन चरण: एसक्यूएल जेनरेट करने के लिए एलएलएम को असेंबल प्रॉम्प्ट भेजें। यदि गोल्डन SQLs फाइन-ट्यूनिंग मॉडल कॉन्फ़िगर किया गया है, तो सटीकता में सुधार के लिए पहले फाइन-ट्यूनिंग मॉडल का उपयोग करें; अन्यथा, सामान्य मॉडल पर वापस आएं। v1.0.2 में पेश किया गया स्ट्रीमिंग एंडपॉइंट एसक्यूएल पीढ़ी के मध्यवर्ती तर्क चरणों को वास्तविक समय में देखने की अनुमति देता है - एलएलएम की विचार श्रृंखला, फ़ील्ड मिलान प्रक्रिया जॉइन स्थिति चयन - जो डिबगिंग और विश्वास निर्माण के लिए महत्वपूर्ण है।
- एनएल जेनरेशन चरण: उत्पन्न एसक्यूएल और निष्पादन परिणामों के लिए उपयोगकर्ता को "इस क्वेरी ने क्या किया" समझाने के लिए प्राकृतिक भाषा का उपयोग करें। यह एक कम अनुमानित लेकिन बेहद मूल्यवान डिज़ाइन है: गैर-तकनीकी उपयोगकर्ता आमतौर पर SQL नहीं पढ़ सकते हैं, लेकिन प्राकृतिक भाषा व्याख्या के माध्यम से वे तुरंत निर्णय ले सकते हैं कि क्वेरी तर्क सही है या नहीं और निर्णय ले सकते हैं कि परिणामों को स्वीकार करना है या नहीं।
स्कीमा जागरूकता और वेक्टर पुनर्प्राप्ति का सहयोग
डेटाहेराल्ड का स्कीमा हैंडलिंग तंत्र इसके और सरल प्रॉम्प्ट रैपर के बीच मुख्य विभाजन रेखा है:
- स्वचालित स्कैनिंग: तालिका नाम, फ़ील्ड नाम, फ़ील्ड प्रकार, टिप्पणियाँ और प्राथमिक और विदेशी कुंजी संबंध प्राप्त करने के लिए
POST /api/v1/table-descriptions/sync-schemasसमापन बिंदु के अतुल्यकालिक पृष्ठभूमि कार्य के माध्यम से डेटाबेस को स्कैन करें। - स्कीमा वेक्टरकृत भंडारण: एंबेडिंग मॉडल का उपयोग करके तालिका और फ़ील्ड विवरण जानकारी (नाम + टिप्पणी) को वेक्टराइज़ करें और इसे पाइनकोन/एस्ट्रा/क्रोमा वेक्टर डेटाबेस में संग्रहीत करें।
- रनटाइम पुनर्प्राप्ति: जब उपयोगकर्ता कोई प्रश्न पूछता है, तो पहले प्रश्न पर एंबेडिंग करें, वेक्टर लाइब्रेरी में टॉप-के संबंधित तालिकाओं और फ़ील्ड को पुनः प्राप्त करें, और केवल इन संदर्भों को एलएलएम प्रॉम्प्ट में इंजेक्ट करें।
- वृद्धिशील कैशिंग: स्कैन परिणाम MongoDB में कैश किए जाते हैं, जो पूर्ण पुनर्निर्माण के बजाय वृद्धिशील अपडेट का समर्थन करते हैं।
POST /api/v1/table-descriptions/refreshसमापन बिंदु (v1.0.1 में प्रस्तुत) को सभी डेटा को दोबारा स्कैन किए बिना तालिका सूची को कुशलतापूर्वक ताज़ा करने के लिए डिज़ाइन किया गया है।
इस तंत्र का इंजीनियरिंग महत्व यह है कि एंटरप्राइज़ डेटाबेस में अक्सर सैकड़ों टेबल और हजारों फ़ील्ड होते हैं। यदि उन सभी को एलएलएम संदर्भ में शामिल किया जाता है, तो टोकन की खपत अस्वीकार्य होगी और एलएलएम गंभीर रूप से विचलित हो जाएगा। वेक्टर पुनर्प्राप्ति + गतिशील इंजेक्शन सटीकता और लागत दोनों को ध्यान में रखते हुए, 3-8 तालिकाओं के भीतर प्रत्येक क्वेरी के स्कीमा संदर्भ को नियंत्रित करता है।
गोल्डन एसक्यूएल पुनरावृत्ति के साथ बंद हुआ
डेटाहेराल्ड का फाइनट्यूनिंग तंत्र एक सतत अनुकूलन प्रक्रिया का गठन करता है:
बिजनेस क्वेरी → एसक्यूएल जेनरेशन → मैन्युअल समीक्षा → गोल्डन एसक्यूएल में स्टोर करें → मॉडल को फाइन-ट्यून करें → सटीकता में सुधार करें
↑
समय-समय पर फाइनट्यूनिंग को ट्रिगर करें
- गोल्डन एसक्यूएल संग्रह: स्टोर मान्य "प्राकृतिक भाषा प्रश्न ↔ मानक एसक्यूएल" जोड़े। प्रत्येक जोड़ी में प्रश्न, एसक्यूएल, db_connection_id और मेटाडेटा शामिल है।
- फाइन-ट्यूनिंग प्रक्रिया: फाइन-ट्यूनिंग कार्य बनाने के लिए
POST /api/v1/finetuningपर कॉल करें, और इंजन स्वचालित रूप से गोल्डन SQL को OpenAI फाइन-ट्यूनिंग के लिए आवश्यक डेटा सेट प्रारूप में प्रारूपित करता है और इसे सबमिट करता है। फ़ाइन-ट्यूनिंग पूरी होने के बाद, आपGET /api/v1/finetuning/{id}के माध्यम से स्थिति के बारे में पूछ सकते हैं। यदि स्थिति सफल है, तो इसका उपयोग SQL पीढ़ी के लिए किया जा सकता है। - वास्तविक परिणाम: आधिकारिक दस्तावेज के अनुसार, फाइन-ट्यून मॉडल मालिकाना व्यावसायिक डोमेन में एसक्यूएल पीढ़ी की सटीकता में काफी सुधार करता है। यद्यपि सटीक मूल्य का खुलासा नहीं किया गया है, यह तार्किक रूप से उचित है: सामान्य मॉडल समझ सकता है कि "बिक्री" SUM(राशि) है, लेकिन उद्यम-विशिष्ट "शुद्ध बिक्री = SUM(राशि)-SUM(छूट)-SUM(रिटर्न)" को नहीं समझता है; फ़ाइन-ट्यूनिंग के बाद, मॉडल इन व्यावसायिक नियमों को सीख सकता है।
मॉडल की स्वतंत्रता और प्रतिस्थापना
डेटाहेराल्ड वास्तुशिल्प स्तर पर अंतर्निहित एलएलएम के अमूर्तन को बनाए रखता है: इंजन कॉन्फ़िगरेशन इंटरफेस के माध्यम से विभिन्न मॉडलों तक पहुंचता है और एक एकल ओपनएआई आपूर्तिकर्ता से बंधा नहीं है। आधिकारिक समर्थन में GPT-4/GPT-3.5, क्लाउड श्रृंखला और स्व-होस्ट किए गए मॉडल (OpenAI API प्रारूप के साथ संगत स्थानीय तैनाती के माध्यम से) शामिल हैं। उद्यम खरीद में इस डिज़ाइन का व्यावहारिक मूल्य है: आप PoC सत्यापन सटीकता की ऊपरी सीमा को पूरा करने के लिए GPT-4 का उपयोग कर सकते हैं, और अनुमान लागत को कम करने और डेटा संप्रभुता को नियंत्रित करने के लिए ऑनलाइन जाने के बाद स्व-होस्ट किए गए मॉडल पर स्विच कर सकते हैं।
बहु-किरायेदारी और अनुमति अलगाव
एंटरप्राइज़ घटक संगठन-व्यापी उपयोगकर्ता प्रबंधन, भूमिका अनुमतियाँ और डेटाबेस कनेक्शन अलगाव प्रदान करता है। प्रत्येक डेटाबेस कनेक्शन को एक स्वतंत्र एलएलएम एपीआई कुंजी के साथ कॉन्फ़िगर किया जा सकता है, जो रीड-ओनली मोड (अपडेट/डिलीट/डीडीएल स्टेटमेंट को जेनरेट होने से रोकना) और डेटा डिसेन्सिटाइजेशन का समर्थन करता है। ये तंत्र बहु-विभागीय या बहु-ग्राहक परिदृश्यों में सख्ती से आवश्यक हैं - विभिन्न विभाग केवल प्राधिकरण दायरे के भीतर तालिकाओं और डेटा को क्वेरी कर सकते हैं।
डेटाहेराल्ड का उपयोग कैसे करें
डेटाहेराल्ड कई प्रवेश और एकीकरण विधियां प्रदान करता है, जो डेवलपर एपीआई एकीकरण से लेकर बिजनेस टीम स्लैक इंटरैक्शन तक विभिन्न उपयोग परिदृश्यों को कवर करता है।
परिनियोजन प्रविष्टि तुलना
| प्रवेश | लागू लोग | स्टार्टअप विधि | पूर्व आवश्यकताएँ |
|---|---|---|---|
| इंजन एपीआई (कोर इंजन) | डेवलपर | डॉकर कंपोज़ इंजन सेवा चलाता है | डॉकर, मोंगोडीबी, एलएलएम एपीआई कुंजी |
| एंटरप्राइज एपीआई (पूर्ण फीचर्ड) | डेवलपर/आईटी एडमिन | डॉकर कंपोज़ सभी 4 सेवाएँ चलाता है | डॉकर, मोंगोडीबी, वेक्टर डेटाबेस एलएलएम एपीआई कुंजी |
| एडमिन कंसोल (प्रशासनिक इंटरफ़ेस) | डेटा विश्लेषक/प्रशासक | एंटरप्राइज़, ब्राउज़र एक्सेस के साथ लॉन्च किया गया | एंटरप्राइज़ एपीआई चल रहा है |
| स्लैकबॉट | बिजनेस टीमें | एंटरप्राइज़, स्लैक ऐप कॉन्फ़िगरेशन के साथ लॉन्च किया गया | एंटरप्राइज़ एपीआई + स्लैक ऐप अनुमतियाँ |
| बाकी एपीआई | डेवलपर | सीधे इंजन/एंटरप्राइज़ एंडपॉइंट पर कॉल करें | परिनियोजित एपीआई बेस यूआरएल |
तीव्र परिनियोजन और स्टार्टअप (स्वयं-होस्टेड)
न्यूनतम कॉन्फ़िगरेशन आवश्यकताएँ (PoC स्तर):
# 1. रिपॉजिटरी को क्लोन करें
गिट क्लोन https://github.com/Dataerald/dataerald.git
सीडीडेटाहेराल्ड
# 2. प्रासंगिक चर कॉन्फ़िगर करें (प्रत्येक सेवा निर्देशिका में .env.example देखें)
# कम से कम कॉन्फ़िगरेशन आवश्यक है: OPENAI_API_KEY, MONGODB_URI
#3. सभी सेवाएँ एक क्लिक से प्रारंभ करें
./docker-run.sh
उपरोक्त कमांड इंजन (पोर्ट 80), एंटरप्राइज़ (पोर्ट 81), एडमिन कंसोल (पोर्ट 3000), और स्लैकबॉट शुरू करेगा, और स्वचालित रूप से एक डॉकर नेटवर्क बनाएगा। स्टार्टअप के बाद, प्रबंधन कंसोल को http://localhost:3000 के माध्यम से एक्सेस किया जा सकता है।
एपीआई कॉल उदाहरण
डेटाबेस कनेक्शन बनाएं:
कर्ल -एक्स पोस्ट http://localhost:80/api/v1/database-connections \
-एच "सामग्री-प्रकार: एप्लिकेशन/जेसन" \
-डी '{
"उपनाम": "उत्पादन_डीबी",
"connection_uri": "postgresql://user:password@host:5432/mydb",
"llm_api_key": "<आपका_LLM_API_KEY>"
}'
सिंक्रनाइज़ स्कीमा:
कर्ल -एक्स पोस्ट http://localhost:80/api/v1/table-descriptions/sync-schemas \
-एच "सामग्री-प्रकार: एप्लिकेशन/जेसन" \
-d '{"db_connection_id": "<connection_id>"}'
प्राकृतिक भाषा प्रश्न आरंभ करें:
कर्ल -एक्स पोस्ट http://localhost:80/api/v1/prompts/sql-जेनरेशन \
-एच "सामग्री-प्रकार: एप्लिकेशन/जेसन" \
-डी '{
"db_connection_id": "<connection_id>",
"प्रश्न": "पिछली तिमाही में क्षेत्र के अनुसार बिक्री रैंकिंग"
}'
सुव्यवस्थित मॉडल:
कर्ल -एक्स पोस्ट http://localhost:80/api/v1/finetuning \
-एच "सामग्री-प्रकार: एप्लिकेशन/जेसन" \
-डी '{
"db_connection_id": "<connection_id>",
"गोल्डन_एसक्यूएल_आईड्स": ["<id1>", "<id2>"]
}'
विशिष्ट उपयोग प्रक्रिया
- आरंभीकरण: सेवा तैनात करें → डेटाबेस कनेक्शन बनाएं → स्कीमा सिंक्रोनाइज़ करें → पुष्टि करें कि स्कैन स्थिति सिंक्रोनाइज़्ड है।
- सत्यापन: पीढ़ी की गुणवत्ता और निष्पादन की शुद्धता की जांच करने के लिए कई बुनियादी प्रश्न (सरल चयन, सशर्त फ़िल्टरिंग) सबमिट करें।
- नमूने जमा करें: उच्च-आवृत्ति व्यावसायिक प्रश्नों के लिए, सत्यापित प्रश्न-एसक्यूएल जोड़े को गोल्डन एसक्यूएल में संग्रहीत करें।
- फाइनट्यूनिंग: ऊर्ध्वाधर डोमेन सटीकता में सुधार के लिए 50+ नमूने जमा करने के बाद फाइनट्यूनिंग शुरू हो जाती है।
- ऑनलाइन जाएं: एडमिन कंसोल भूमिका अनुमतियाँ कॉन्फ़िगर करें → व्यावसायिक टीमों के लिए खोलें → क्वेरी लॉग और त्रुटि दरों की निगरानी करें।
- पुनरावृत्ति: नियमित रूप से क्वेरी लॉग की समीक्षा करें, गोल्डन एसक्यूएल में नए क्वेरी पैटर्न जोड़ें और फाइन-ट्यूनिंग जारी रखें।
प्रीसेट नोट्स
- यदि उपयोगकर्ता की डेटाबेस तालिका और फ़ील्ड नाम गैर-अंग्रेजी (जैसे चीनी) में हैं, तो डेटाहेराल्ड की स्कीमा स्कैनिंग और एलएलएम समझ काफी कम हो जाएगी - यह वर्तमान संस्करण की मुख्य भाषा सीमाओं में से एक है।
- उत्पादन उपयोगकर्ताओं के लिए, पहले केवल-पढ़ने के लिए मोड को सक्षम करने की अनुशंसा की जाती है, और फिर यह पुष्टि करने के बाद अनुमतियों में ढील दी जाती है कि SQL पीढ़ी अप्रत्याशित अद्यतन/हटाएं संचालन का कारण नहीं बनेगी।
- बड़े पुस्तकालयों के लिए स्कीमा स्वचालित स्कैनिंग में कई मिनट लग सकते हैं। v1.0.1 में प्रस्तुत
/रिफ्रेशसमापन बिंदु वृद्धिशील अद्यतन समय को काफी कम कर सकता है।
डेटाहेराल्ड के लिए उत्पाद मूल्य निर्धारण
डेटाहेराल्ड की मूल्य निर्धारण प्रणाली को दो पथों में विभाजित किया गया है: ओपन सोर्स सामुदायिक संस्करण और एंटरप्राइज़ वाणिज्यिक संस्करण। एंटरप्राइज़ संस्करण की आधिकारिक कीमत का खुलासा नहीं किया गया है।
ओपन सोर्स सामुदायिक संस्करण (अपाचे-2.0):
- शुल्क: पूरी तरह से मुफ़्त, उपयोगकर्ताओं की संख्या, क्वेरी वॉल्यूम या डेटाबेस कनेक्शन पर कोई सीमा नहीं।
- सामग्री शामिल: इंजन (कोर इंजन) + एंटरप्राइज (मल्टी-टेनेंट एपीआई) + एडमिन कंसोल (प्रबंधन इंटरफ़ेस) + स्लैकबॉट (स्लैक एकीकरण) के सभी स्रोत कोड।
- लागू शर्तें: डॉकर कंपोज़ चलाने के लिए आपको अपने स्वयं के सर्वर या क्लाउड होस्ट की आवश्यकता है, और MongoDB, वेक्टर डेटाबेस और LLM API कुंजी को स्वयं कॉन्फ़िगर करें।
- व्यावसायिक उपयोग प्रतिबंध: Apache-2.0 लाइसेंस मुफ्त उपयोग और संशोधन की अनुमति देता है, लेकिन उत्पाद को सीधे SaaS सेवा (लाइसेंस शर्तों के अधीन) के रूप में पुनर्वितरित करने की अनुमति नहीं है।
एंटरप्राइज़ संस्करण (अघोषित मूल्य निर्धारण):
- शामिल होने का अनुमान: एसएसओ (एसएएमएल/ओआईडीसी) एकीकरण, ऑडिट लॉग, समर्पित एसएलए समर्थन, प्राथमिकता तकनीकी समर्थन, एंटरप्राइज़-ग्रेड परिनियोजन गाइड।
- बिलिंग आयाम अटकलें: डेटाबेस कनेक्शन की संख्या + मासिक एपीआई कॉल + उपयोगकर्ता सीटों की संख्या के आधार पर एक संयुक्त सदस्यता मॉडल। समान ओपन सोर्स व्यावसायीकरण परियोजनाओं (जैसे N8n, Appsmith) का संदर्भ लेते हुए, एंटरप्राइज़ संस्करण के लिए वार्षिक शुल्क $5,000-$50,000 की सीमा में हो सकता है, लेकिन यह केवल एक उद्योग अनुमान है, और आधिकारिक उद्धरण मान्य होगा।
- अधिग्रहण विधि: कोटेशन और परीक्षण प्राप्त करने के लिए आपको आधिकारिक बिक्री टीम से संपर्क करना होगा। आधिकारिक वेबसाइट स्व-सेवा खरीद प्रवेश द्वार प्रदान नहीं करती है।
एलएलएम कॉल शुल्क (डेटाहेराल्ड उत्पाद शुल्क से अलग):
- यह डेटाहेराल्ड का उपयोग करने के लिए एक अतिरिक्त लागत है और यह सीधे उपयोगकर्ता की एलएलएम प्रदाता की पसंद और कॉल की मात्रा पर निर्भर है।
- GPT-4 की एक विशिष्ट NL2SQL क्वेरी लगभग 2,000-5,000 टोकन (इनपुट स्कीमा + प्रश्न) की खपत करती है, और GPT-4 के आधार पर इसकी कीमत लगभग $0.01-0.03/समय है। उच्च-आवृत्ति परिदृश्यों के लिए मासिक एलएलएम शुल्क (प्रतिदिन औसतन 10,000 बार) $3,000-$9,000 है।
- GPT-3.5-टर्बो या स्वयं-होस्टेड मॉडल का उपयोग करने से निर्माण सटीकता की संभावित कीमत पर, इस लागत को 10-30x तक कम किया जा सकता है।
- यह अनुशंसा की जाती है कि एलएलएम कॉल की लागत को बजट मॉडल में आरक्षित किया जाए, जो आमतौर पर डेटाहेराल्ड के स्वयं के बुनियादी ढांचे की लागत से अधिक है।
डेटाहेराल्ड के अनुप्रयोग परिदृश्य
परिदृश्य 1: व्यवसाय टीम स्वयं डेटा एकत्र करती है
कार्य विवरण: गैर-तकनीकी टीमों जैसे बाज़ार संचालन, बिक्री प्रबंधन और वित्तीय विश्लेषण को अक्सर डेटा वेयरहाउस से रिपोर्ट प्राप्त करने की आवश्यकता होती है। पारंपरिक प्रक्रिया के लिए ①बीआई टूल में रिपोर्ट के लिए आवेदन करना → ② डेटा वेयरहाउस टीम के शेड्यूल की प्रतीक्षा करना → ③ बार-बार मांग विवरण पर संचार करना → ④ स्थिर रिपोर्ट प्राप्त करना आवश्यक है। डेटाहेराल्ड इसे इस प्रकार सरल बनाता है: उपयोगकर्ता सीधे स्लैक या एडमिन कंसोल में प्राकृतिक भाषा में प्रश्न पूछते हैं और तुरंत क्वेरी परिणाम प्राप्त करते हैं।
वास्तविक आय:
- एकल क्वेरी चक्र को औसतन 4-6 घंटे से घटाकर 1-3 मिनट (कटौती) कर दिया गया है।
- डेटा टीम को दोहराए जाने वाले "एसक्यूएल-संशोधित एसक्यूएल लिखें" से मुक्त किया गया है और डेटा मॉडलिंग और गवर्नेंस पर ध्यान केंद्रित किया गया है।
- व्यावसायिक टीमें शेड्यूलिंग की प्रतीक्षा किए बिना स्वतंत्र रूप से डेटा का पता लगा सकती हैं, और निर्णय लेने की प्रतिक्रिया की गति में सुधार होता है।
कार्यान्वयन सत्यापन का फोकस: क्या व्यावसायिक उपयोगकर्ता "रिपोर्ट की प्रतीक्षा" की आदत को बदलने और प्राकृतिक भाषा में सक्रिय रूप से प्रश्न पूछने के इच्छुक हैं; और क्या सामान्य प्रश्नों की पहली पीढ़ी की सटीकता दर 70%+ तक पहुंचती है (इस मूल्य से नीचे उपयोगकर्ताओं को हार माननी पड़ेगी)।
परिदृश्य 2: SaaS उत्पाद एम्बेडेड डेटा प्रश्नोत्तर क्षमताएँ
कार्य विवरण: सीआरएम, ईआरपी और प्रोजेक्ट प्रबंधन जैसे डेटा-सघन SaaS उत्पाद अंतिम उपयोगकर्ताओं को जटिल फ़िल्टरिंग इंटरफेस के माध्यम से प्राकृतिक भाषा के माध्यम से उत्पाद डेटा को क्वेरी करने की अनुमति देने की उम्मीद करते हैं। डेटाहेराल्ड के इंजन एपीआई को उत्पाद के "डेटा विश्लेषण सहायक" सुविधा के रूप में एम्बेड किया जा सकता है।
वास्तविक आय:
- उपयोगकर्ता सीखने की लागत कम करें - फ़िल्टर सिंटैक्स सीखने की आवश्यकता नहीं है, आप अपनी मूल भाषा में प्रश्न पूछकर डेटा प्राप्त कर सकते हैं।
- उत्पाद में पूर्व निर्धारित रिपोर्ट के विकास और रखरखाव कार्य को कम करें - गतिशील पीढ़ी निश्चित रिपोर्ट की जगह लेती है।
- उपयोगकर्ता चिपचिपाहट और डेटा गतिविधि में सुधार करें, निष्क्रिय देखने को सक्रिय और निष्क्रिय अन्वेषण में बदलें।
कार्यान्वयन सत्यापन का फोकस: क्या बहु-किरायेदार डेटा अलगाव सटीक रूप से प्राप्त किया जा सकता है (किरायेदार ए के उपयोगकर्ता एसक्यूएल इंजेक्शन के माध्यम से किरायेदार बी का डेटा नहीं देख सकते हैं); और क्या उच्च संगामिति (जैसे SaaS के व्यस्ततम घंटे) के तहत इंजन का प्रतिक्रिया प्रदर्शन स्वीकार्य सीमा के भीतर है।
परिदृश्य 3: डेटा विश्लेषण त्वरण - जटिल क्वेरी कंकाल पीढ़ी
कार्य विवरण: जब पेशेवर डेटा विश्लेषकों को जटिल विश्लेषण आवश्यकताओं का सामना करना पड़ता है जिसके लिए मल्टी-टेबल जॉइन, विंडो फ़ंक्शंस और सबक्वेरीज़ की आवश्यकता होती है, तो वे SQL स्केलेटन को जल्दी से उत्पन्न करने के लिए डेटाहेराल्ड का उपयोग करते हैं, और फिर इस आधार पर फाइन-ट्यून और ऑप्टिमाइज़ करते हैं।
वास्तविक आय:
- एसक्यूएल लेखन दक्षता 2-3 गुना बढ़ने का अनुमान है, विशेष रूप से अपरिचित तालिका संरचनाओं के लिए (स्कीमा परिभाषा को मैन्युअल रूप से जांचने की कोई आवश्यकता नहीं है)।
- निम्न-स्तरीय सिंटैक्स त्रुटियों को कम करें - एआई पीढ़ी के माध्यम से जॉइन स्थिति त्रुटियों, ग्रुप बाय चूक, समग्र कार्यों के दुरुपयोग आदि से बचा जा सकता है।
- विश्लेषक SQL सिंटैक्स डिबगिंग के बजाय डेटा विश्लेषण और व्यावसायिक व्याख्या पर अधिक ध्यान केंद्रित कर सकते हैं।
कार्यान्वयन सत्यापन के मुख्य बिंदु: जटिल प्रश्नों के लिए डेटाहेराल्ड की पीढ़ी की गुणवत्ता (4 से अधिक टेबल जॉइन, रिकर्सिव सीटीई, डायनेमिक पिवोट)। वर्तमान संस्करण में बहुत जटिल प्रश्नों पर सीमित स्थिरता है, और विश्लेषकों को उत्पन्न परिणामों पर पूरी तरह भरोसा करने के बजाय, समीक्षा करने और सही करने के लिए SQL क्षमताओं की आवश्यकता है।
परिदृश्य 4: सुस्त एंबेडेड डेटा ऑपरेशन
कार्य विवरण: उद्यम डेटाबेस क्वेरी क्षमताओं को स्लैकबॉट घटकों के माध्यम से दैनिक कार्य संचार चैनलों में एम्बेड करते हैं। प्रबंधन ने सीधे चैनल में "इस सप्ताह नए ग्राहकों की संख्या" पूछी, और रोबोट ने डेटा के साथ उत्तर दिया; ऑपरेशन स्टाफ ने "क्षेत्र के अनुसार वितरण" पूछा, और संदर्भ सुसंगत रहा।
वास्तविक आय:
- डेटा अधिग्रहण में शून्य घर्षण-गिनती, विश्लेषण और साझा करने की पूरी प्रक्रिया स्लैक को छोड़े बिना पूरी की जा सकती है।
- क्वेरी परिणाम और वार्तालाप रिकॉर्ड स्वाभाविक रूप से स्लैक चैनलों में सहेजे जाते हैं, जिससे एक ट्रेस करने योग्य डेटा चर्चा इतिहास बनता है।
- उद्यम के भीतर "डेटा द्वीप" प्रभाव को कम करें - गैर-तकनीकी भूमिकाएँ सार्वजनिक चैनलों में डेटा वार्तालाप देखती हैं और डेटा क्वेरी व्यवहारों को सूक्ष्मता से सीखती हैं और उनका अनुकरण करती हैं।
कार्यान्वयन सत्यापन के मुख्य बिंदु: स्लैकबॉट की लंबी बातचीत के संदर्भ को बनाए रखने की क्षमता; और स्लैक चैनलों में प्रदर्शित संवेदनशील डेटा के अनुपालन जोखिम (क्या पीआईआई फ़ील्ड को फ़िल्टर करने की आवश्यकता है)।
डेटाहेराल्ड के लागू समूह
कोर अनुकूलन भीड़
-
डेटा विश्लेषक: आप SQL स्केलेटन को शीघ्रता से उत्पन्न करने, कार्य के दोहराव को कम करने और डेटा अंतर्दृष्टि के लिए अधिक समय देने के लिए डेटाहेराल्ड का उपयोग कर सकते हैं। अनुकूलन के लिए शर्त यह है कि विश्लेषकों के पास SQL ऑडिट क्षमताएं हों और वे AI द्वारा उत्पन्न अपूर्ण SQL को ठीक कर सकें। अनुपयुक्त परिदृश्य: उत्पादन परिदृश्य जिनमें जटिल प्रश्नों के लिए सख्त गुणवत्ता आवश्यकताएँ होती हैं और वे किसी भी SQL त्रुटि को बर्दाश्त नहीं कर सकते।
-
बिजनेस ऑपरेशंस/मार्केटिंग/सेल्स टीम: डेटा टीम पर निर्भरता से छुटकारा पाकर सीधे प्राकृतिक भाषा के माध्यम से डेटा रिपोर्ट प्राप्त करें। अनुकूलन के लिए शर्त यह है कि उद्यम का डेटा मॉडल अपेक्षाकृत मानकीकृत है (फ़ील्ड नाम स्पष्ट और एनोटेटेड हैं), और क्वेरी आवश्यकताएं जटिल बहु-चरण विश्लेषण के बजाय मुख्य रूप से एकत्रित रिपोर्ट (योग, गणना, रैंकिंग, रुझान) पर आधारित हैं। अनुपयुक्त परिदृश्य: ऐसी परिस्थितियाँ जिनमें अत्यधिक उच्च डेटा सटीकता की आवश्यकता होती है (जैसे वित्तीय समाधान), या जहाँ क्वेरी भाषा चीनी है और तालिका/फ़ील्ड नाम भी चीनी में हैं।
-
आईटी/डेटा इंजीनियर: डेटाहेराल्ड सिस्टम की तैनाती, रखरखाव और गोल्डन एसक्यूएल नमूना प्रबंधन के लिए जिम्मेदार। अनुकूलन के लिए शर्त यह है कि टीम के पास डॉकर संचालन और रखरखाव क्षमताएं हों और वह स्कीमा कॉन्फ़िगरेशन, नमूना संचय और मॉडल फाइन-ट्यूनिंग के निरंतर अनुकूलन में समय निवेश करने को तैयार हो। अनुपयुक्त परिदृश्य: ऐसी टीमें जिनके पास पूर्णकालिक संचालन और रखरखाव कर्मी नहीं हैं, या डेटाबेस एक पुरानी प्रणाली है (फ़ील्ड नाम अर्थहीन और टिप्पणी रहित हैं), या डेटा अपडेट आवृत्ति बहुत अधिक है (स्तर प्रति मिनट) और वास्तविक समय स्कीमा जागरूकता की आवश्यकता होती है।
-
सास उत्पाद प्रबंधक/तकनीकी नेतृत्व: डेटा विश्लेषण क्षमताएं प्रदान करने के लिए डेटाहेराल्ड को अपने उत्पादों में एम्बेड करने का मूल्यांकन करें। अनुकूलन का आधार यह है कि उत्पाद का डेटा परिदृश्य मुख्य रूप से अमेरिकी/यूरोपीय अंग्रेजी बाजार में क्वेरी-उन्मुख उपयोगकर्ताओं के लिए है। अनुपयुक्त परिदृश्य: चीनी बाजार को लक्षित करने वाले उत्पाद (डेटा तालिका नाम और फ़ील्ड नाम चीनी में होने पर सटीकता काफी कम हो जाती है), या ऐसे उत्पाद जिन्हें उन्नत अनुमति ऑडिटिंग और मल्टी-लेयर डेटा अलगाव की आवश्यकता होती है।
अनुपयुक्त सीमाएँ और पूर्व शर्ते
- भाषा सीमा: डेटाहेराल्ड की स्कीमा स्कैनिंग और एनएल पीढ़ी मुख्य कामकाजी भाषा के रूप में अंग्रेजी का उपयोग करती है। यद्यपि अंतर्निहित एलएलएम चीनी इनपुट को संभाल सकता है, पूरे सिस्टम के स्कीमा फ़ील्ड विवरण, त्रुटि संदेश और प्रबंधन इंटरफ़ेस अंग्रेजी के लिए डिज़ाइन किए गए हैं। चीनी तालिका नामों और फ़ील्ड नामों वाले परिदृश्यों में, DB-GPT जैसे चीनी अनुकूलन समाधानों को प्राथमिकता देने की अनुशंसा की जाती है।
- डेटाबेस विखंडन: यदि किसी उद्यम का डेटाबेस 50+ स्वतंत्र उदाहरणों पर वितरित किया जाता है, जिनमें से प्रत्येक को कनेक्शन और स्कीमा स्कैन के अलग-अलग कॉन्फ़िगरेशन की आवश्यकता होती है, और रखरखाव लागत रैखिक रूप से बढ़ जाती है। यह अनुशंसा की जाती है कि केवल कोर डेटा वेयरहाउस तक ही पहुंचा जाए, और एज डेटाबेस को अभी भी पारंपरिक तरीकों की आवश्यकता होती है।
- मॉडल निर्भरता जोखिम: डेटाहेराल्ड किसी एक मॉडल को बांधता नहीं है, लेकिन एसक्यूएल पीढ़ी की गुणवत्ता चुने हुए एलएलएम की क्षमताओं पर अत्यधिक निर्भर है। यदि आप GPT-3.5-टर्बो जैसे कम लागत वाले मॉडल चुनते हैं, तो जटिल प्रश्नों पर सटीकता उत्पादन आवश्यकताओं को पूरा नहीं कर सकती है; यदि आप GPT-4 चुनते हैं, तो अनुमान लागत बजट बोझ बन सकती है। यह अनुशंसा की जाती है कि पीओसी चरण के दौरान कई मॉडल संयोजनों का एक साथ परीक्षण किया जाए।
- डेटा सुरक्षा ऑडिट: हालांकि एंटरप्राइज़ घटक बुनियादी प्रमाणीकरण और बहु-किरायेदार सहायता प्रदान करता है, अधिकारी एसओसी2/जीडीपीआर जैसी अनुपालन प्रमाणन जानकारी का खुलासा नहीं करता है। वित्त और चिकित्सा जैसे मजबूत अनुपालन उद्योगों को खरीदारी से पहले बिक्री टीम के साथ अनुपालन शर्तों की पुष्टि करने की आवश्यकता होती है।
सारांश और आउटलुक
डेटाहेराल्ड एंटरप्राइज़-स्तरीय NL2SQL ट्रैक में एक उच्च इंजीनियर ओपन सोर्स समाधान प्रदान करता है। इसका मुख्य मूल्य तीन-चरण पाइपलाइन वास्तुकला स्कीमा-जागरूक वेक्टर पुनर्प्राप्ति और गोल्डन एसक्यूएल बंद फाइन-ट्यूनिंग तंत्र में निहित है। ये डिज़ाइन इसे साधारण एलएलएम प्रॉम्प्ट रैपर से अलग करते हैं।
वर्तमान लाभ:
- विस्तृत डेटाबेस कवरेज (9 प्रकार के रिलेशनल डेटाबेस + 3 प्रकार के वेक्टर स्टोरेज), जो ओपन सोर्स NL2SQL समाधान का नेतृत्व करता है।
- पूर्ण घटक (इंजन + एंटरप्राइज + एडमिन कंसोल + स्लैकबॉट), एंटरप्राइज़-स्तरीय डिलीवरी फॉर्म के करीब।
- मॉडल-स्वतंत्र डिज़ाइन, किसी एक एलएलएम आपूर्तिकर्ता से बंधा नहीं, लागत और परिदृश्य के अनुसार स्विचिंग की अनुमति देता है।
- "जितना अधिक आप इसका उपयोग करेंगे, यह उतना ही अधिक सटीक होगा" संबंध गोल्डन एसक्यूएल + फाइनट्यूनिंग द्वारा बनता है, जो मालिकाना व्यावसायिक डोमेन में सटीकता में लगातार सुधार करता है।
वर्तमान सीमाएँ:
- परियोजना ने v1.0.3 के बाद से कम-सक्रिय रखरखाव अवधि में प्रवेश किया है। आधे साल के भीतर कोई नया फीचर संस्करण नहीं है, और सामुदायिक योगदान मुख्य रूप से मामूली मरम्मत पर ही रहता है। किसी मॉडल का चयन करते समय दीर्घकालिक रखरखाव जोखिमों का आकलन किया जाना चाहिए, और यदि आवश्यक हो तो एक कांटा स्व-रखरखाव योजना को बरकरार रखा जाना चाहिए।
- अपर्याप्त चीनी प्राकृतिक भाषा समर्थन - स्कीमा स्कैनिंग और फ़ील्ड विवरण एनएल जेनरेशन मुख्य रूप से अंग्रेजी में हैं, और चीनी तालिका नामों/फ़ील्ड नामों की परिदृश्य प्रयोज्यता सीमित है।
- अल्ट्रा-कॉम्प्लेक्स SQL (5 से अधिक तालिकाओं, पुनरावर्ती CTE, डायनेमिक PIVOT, मल्टी-लेवल सबक्वेरी नेस्टिंग के साथ जुड़ें) की पीढ़ी की गुणवत्ता पर्याप्त स्थिर नहीं है, जिसके लिए विश्लेषकों द्वारा माध्यमिक समीक्षा की आवश्यकता होती है, और इसे पूरी तरह से स्वचालित नहीं किया जा सकता है।
- मुख्य व्यावसायिक जानकारी जैसे एंटरप्राइज़ संस्करण मूल्य निर्धारण, एसएलए प्रतिबद्धता, और अनुपालन प्रमाणन (एसओसी2/जीडीपीआर) का आधिकारिक तौर पर खुलासा नहीं किया गया है। उद्यमों को खरीदारी से पहले बिक्री चैनलों के माध्यम से एक-एक करके पुष्टि करनी होगी।
उद्योग आउटलुक: NL2SQL "उपयोग करने योग्य" से "उपयोग में आसान" की ओर बढ़ रहा है, और डेटाहेराल्ड (स्कीमा जागरूकता + फाइन-ट्यूनिंग क्लोजर + बहु-घटक सहयोग) द्वारा दर्शाया गया इंजीनियरिंग मार्ग सही दिशा है। जैसे-जैसे एलएलएम की बुनियादी क्षमताओं में सुधार जारी रहेगा (जैसे कि एसक्यूएल पीढ़ी में डीपसीक-वी4 और जीपीटी-5 जैसे नए मॉडल की प्रगति), एनएल2एसक्यूएल की सटीकता की बाधा धीरे-धीरे कम हो जाएगी। तब तक, डेटाहेराल्ड जैसे मध्यम स्तरीय प्लेटफ़ॉर्म जिनके पास पर्याप्त इंजीनियरिंग तैयारी है, को सीधे लाभ होगा। लेकिन आधार यह है कि परियोजना अपनी रखरखाव लय को फिर से शुरू कर सकती है, अन्यथा यह उच्च सामुदायिक गतिविधि (जैसे डीबी-जीपीटी, वन्ना) वाले विकल्पों द्वारा कार्यक्षमता और पारिस्थितिकी में आगे निकल जाएगी।
खरीद/गोद लेने का जोखिम मूल्यांकन: यह अनुशंसा की जाती है कि डेटाहेराल्ड को "कोर डेटा इंफ्रास्ट्रक्चर" के बजाय "गैर-महत्वपूर्ण पथ डेटा क्वेरी त्वरक" के रूप में पेश किया जाए। पहले 2-4 सप्ताह के लिए एक छोटे से क्षेत्र (1-2 बिजनेस टीम और 5-10 कोर टेबल) में पीओसी करने के लिए ओपन सोर्स संस्करण का उपयोग करें, यह सत्यापित करने पर ध्यान केंद्रित करें कि क्या अंग्रेजी प्रश्नों की सटीकता 70%+ तक पहुंचती है, ② अपने डेटाबेस पर स्कीमा स्कैनिंग और वेक्टर पुनर्प्राप्ति का प्रदर्शन, और ③ फाइन-ट्यूनिंग के बाद प्रभाव में सुधार। पीओसी पारित होने के बाद, हम मूल्यांकन करेंगे कि क्या इसे व्यापक व्यावसायिक परिदृश्यों तक बढ़ाया जा सकता है और क्या एंटरप्राइज़ संस्करण समर्थन सेवाओं की आवश्यकता है। यदि परियोजना लंबे समय तक सक्रिय रखरखाव पर वापस नहीं आती है, तो प्रवासन लक्ष्य के रूप में अधिक सक्रिय समुदाय के साथ विकल्पों के मूल्यांकन को प्राथमिकता देने की सिफारिश की जाती है।
संबंधित उपकरण: github-copilot, कर्सर
संस्करण जानकारी
- स्थिर रिलीज :पहला स्थिर संस्करण मल्टी-राउंड संवाद संदर्भ, जटिल जॉइन और सबक्वेरी पीढ़ी का समर्थन करता है। अभी तक कोई आधिकारिक सटीक तारीख नहीं है।
- बीटा :बीटा परीक्षण संस्करण, बुनियादी टेक्स्ट-टू-एसक्यूएल क्वेरी का समर्थन करता है, अभी तक कोई आधिकारिक सटीक तारीख नहीं है।
उपयोगकर्ता समीक्षाएं