बाइटडांस डॉल्फिन मुफ्त

-

बाइटडांस डॉल्फिन बाइटडांस का ओपन सोर्स दस्तावेज़ पार्सिंग मॉडल है। यह पीडीएफ, स्कैन किए गए दस्तावेजों और जटिल लेआउट दस्तावेजों के आसपास संरचना पहचान, सामग्री निष्कर्षण और मार्कडाउन/जेएसओएन आउटपुट करता है। इसका मुख्य लाभ दो-चरणीय दस्तावेज़ समझ और समानांतर पार्सिंग की दक्षता है।

बाइटडांस डॉल्फिन उत्पाद इंटरफेस

बाइटडांसडॉल्फिन

मुख्य पैरामीटर और आँकड़े

[एक वाक्य में एक संक्षिप्त टिप्पणी]: यह "एक और ओसीआर मॉडल" नहीं है, बल्कि एक दस्तावेज़ संरचना इंजन है जो लेआउट समझ, पढ़ने के क्रम, तत्व क्रॉपिंग और सामग्री पार्सिंग को निष्पादन के दो चरणों में विभाजित करता है।

[प्रचार सत्यापन]: आधिकारिक वेयरहाउस डॉल्फिन-वी2 को एक सार्वभौमिक दस्तावेज़ पार्सिंग मॉडल के रूप में वर्णित करता है। यह कथन अतिशयोक्ति नहीं है, क्योंकि यह डिजिटल-जन्मे और फोटोग्राफ किए गए दस्तावेज़ों के बीच स्पष्ट रूप से अंतर करता है, और विभिन्न दस्तावेज़ पथों के लिए अलग-अलग पार्सिंग रणनीतियों को अपनाता है। हालाँकि, "सार्वभौमिक" का अर्थ "बुद्धिहीन, सर्व-समावेशी" नहीं है। जटिल स्कैन किए गए दस्तावेज़, क्रॉस-पेज तर्क और चरम तालिकाओं को अभी भी अतिरिक्त सत्यापन की आवश्यकता है।

प्रोजेक्ट्स सार्वजनिक सूचना
वर्तमान मेनलाइन डॉल्फिन-v2
पैरामीटर स्केल v1/v1.5 0.3B है, v2 को 3B में अपग्रेड किया गया है
पेपर स्थिति एसीएल 2025 स्वीकृति
ओपन सोर्स पोर्टल GitHub, हगिंग फेस, arXiv
समर्थन आउटपुट JSON, मार्कडाउन, तत्व-स्तर के परिणाम
प्रमुख क्षमताएं लेआउट विश्लेषण, पढ़ने के क्रम की भविष्यवाणी, तालिका/सूत्र/कोड विश्लेषण, बहु-पृष्ठ पीडीएफ
सार्वजनिक प्रदर्शन ओमनीडॉकबेंच पर डॉल्फिन-वी2 मेट्रिक्स v1.5 और v1 से काफी बेहतर हैं
समुदाय का आकार GitHub लगभग 9 हजार सितारे, 772 कांटे

विशेषज्ञ का दृष्टिकोण: डॉल्फिन के बारे में देखने लायक बात "दूसरों के साथ प्रतिस्पर्धा करना" नहीं है, बल्कि यह है कि इसने "पहले लेआउट को समझें, फिर सामग्री का विश्लेषण करें" को एक इंजीनियरिंग मार्ग बना दिया है। यह सीधे तौर पर निर्धारित करता है कि जटिल दस्तावेज़ परिदृश्यों में संरचित और डाउनस्ट्रीम उपभोज्य परिणाम प्राप्त करना उन समाधानों की तुलना में आसान है जो केवल एंड-टू-एंड ओसीआर करते हैं।

उपयोगकर्ता और बाज़ार की पहचान

GitHub पर लगभग 9k सितारे और 772 कांटे संकेत करते हैं कि डॉल्फ़िन को महत्वपूर्ण डेवलपर का ध्यान मिला है। दस्तावेज़ पार्सिंग के एक ओपन सोर्स मॉडल के लिए, यह आकार यह दिखाने के लिए पर्याप्त है कि यह प्रयोगशाला के भीतर एक अस्थायी परियोजना नहीं है, बल्कि एक उपकरण श्रृंखला घटक है जिसे वास्तविक टीमों द्वारा आज़माया और फिर से एकीकृत किया जाएगा।

उपयोगकर्ता और बाजार की पहचान: अधिकारी ने एसीएल पेपर हगिंग फेस मॉडल कार्ड और डेमो भी एक साथ जारी किया, जिसका अर्थ है कि यह शोधकर्ताओं और इंजीनियरिंग टीमों दोनों पर लक्षित है। विशेष रूप से दस्तावेज़ डिजिटलीकरण, ज्ञान आधार सफाई और बिल/रिपोर्ट प्रसंस्करण करने वाली टीमों के लिए, इस प्रकार का मॉडल जो JSON/मार्कडाउन को कार्यान्वित कर सकता है, केवल पाठ को पहचानने की तुलना में अधिक व्यावहारिक है।

प्रचार सत्यापन: यदि आप इसकी व्याख्या "सभी वाणिज्यिक ओसीआर सुइट्स को बदलने" के रूप में करते हैं, तो यह स्पष्ट रूप से बहुत अधिक है; लेकिन यदि आप इसे ओपन सोर्स दस्तावेज़ पार्सिंग प्लेटफ़ॉर्म के मुख्य इंजन के रूप में रखते हैं, तो आधिकारिक क्षमता सीमाएँ विश्वसनीय हैं।

छिपे हुए लाभ: ओसीआर की तुलना में जो केवल सादे पाठ का एक पूरा पृष्ठ लौटाता है, डॉल्फिन का संरचित आउटपुट पोस्ट-प्रोसेसिंग नियमों और मैन्युअल सफाई लागत को काफी कम कर सकता है, जो विशेष रूप से लंबे दस्तावेजों, तालिकाओं और फॉर्मूला परिदृश्यों में स्पष्ट है।

लागत लाभ

मुफ़्त के बारे में सच्चाई: डॉल्फ़िन खुला स्रोत और मुफ़्त है, लेकिन मुफ़्त का मतलब कम सीमा नहीं है। V2 को 3B में अपग्रेड करने के बाद, हालांकि प्रभाव अधिक मजबूत है, अनुमान संसाधनों, मॉडल डाउनलोडिंग और तैनाती की जटिलता भी बढ़ जाएगी। केवल हल्की ओसीआर करने वाली टीमों के लिए, वास्तविक तुलना लाइसेंस मूल्य के बजाय "कुल सिस्टम लागत" है।

लागत परत खुलासा इसका वास्तव में क्या मतलब है
सी-साइड/पर्सनल कोई स्वतंत्र उपभोक्ता उत्पाद नहीं एक सामान्य उपयोगकर्ता ऐप की तुलना में अधिक R&D घटक की तरह
डेवलपर/एपीआई खुला स्रोत और निःशुल्क, स्वयं द्वारा तैनात किया जा सकता है लागत कंप्यूटिंग शक्ति, मॉडल डाउनलोड, अनुमान ढांचे और रखरखाव में निहित है
उद्यम कोई सार्वजनिक वाणिज्यिक पैकेज नहीं यदि आप उत्पादन में प्रवेश करते हैं, तो आपको अनुमतियाँ, ऑडिटिंग, लचीलेपन और एसएलए को स्वयं पूरा करना होगा

छिपी हुई लागत: पहला है मॉडल और अनुमान ढांचे का चयन। vLLM, TensorRT-LLM और ट्रांसफॉर्मर्स समाधानों में से प्रत्येक में इंजीनियरिंग ट्रेडऑफ़ हैं। दूसरा दस्तावेज़ पूर्व-प्रसंस्करण की लागत है। खराब छवि गुणवत्ता, रोटेशन, छायाकरण और बहु-भाषा मिश्रण से त्रुटियां बढ़ेंगी। तीसरा डाउनस्ट्रीम स्कीमा संरेखण है। संरचना की पहचान करने में सक्षम होने का मतलब इसे सीधे और हानिरहित तरीके से व्यवसाय प्रणाली में लिखने में सक्षम होना नहीं है।

छिपे हुए लाभ: यदि कंपनी अभी भी "पूर्ण पाठ की ओसीआर मान्यता + नियमों के एक समूह का कठिन विध्वंस" की पुरानी पद्धति का उपयोग कर रही है, तो डॉल्फिन जैसे संरचित मॉडल नियम रखरखाव और मैन्युअल पुन: कार्य की लागत को बचा सकते हैं।

मुख्य कार्य

  • दो-चरणीय दस्तावेज़ पार्सिंग: पहले वर्गीकृत करें और लेआउट विश्लेषण करें, और फिर सामग्री को तत्व या संपूर्ण पृष्ठ के आधार पर पार्स करें।
  • रीडिंग ऑर्डर भविष्यवाणी: न केवल तत्वों की पहचान करता है, बल्कि प्राकृतिक रीडिंग ऑर्डर को पुनर्स्थापित करने का भी प्रयास करता है, जो मार्कडाउन आउटपुट के लिए विशेष रूप से महत्वपूर्ण है।
  • मल्टी-ग्रैन्युलैरिटी विश्लेषण: पृष्ठ-स्तरीय और तत्व-स्तरीय प्रसंस्करण विधियों का समर्थन करता है।
  • जटिल तत्व निष्कर्षण: पाठ, तालिकाओं, सूत्रों, कोड और अन्य तत्वों को कवर करना।
  • मल्टी-पेज पीडीएफ समर्थन: आधिकारिक चेंजलॉग ने मल्टी-पेज पीडीएफ पार्सिंग क्षमताओं का खुलासा किया है।
  • अनुमान त्वरण अनुकूलन: वीएलएलएम, टेन्सोरआरटी-एलएलएम, आदि के लिए समर्थन इंगित करता है कि यह वास्तविक तैनाती के लिए उन्मुख है, न कि शुद्ध कागज पुनरुत्पादन के लिए।

विशेषज्ञ का दृष्टिकोण: यहां सबसे महत्वपूर्ण छिपा हुआ लिंकेज "लेआउट -> एलिमेंट क्लिपिंग -> स्पेशल प्रॉम्प्ट वर्ड विश्लेषण" है। इसका मतलब है कि विभिन्न तत्व अब एक ही पार्सिंग टोन और आउटपुट टेम्पलेट साझा नहीं करते हैं, जो जटिल दस्तावेजों की गुणवत्ता में सुधार का मुख्य स्रोत है।

मॉडल और संस्करण विकास

प्रारंभिक चरण

डॉल्फ़िन 1.0: 2025-05-20 प्री-ट्रेनिंग मॉडल और अनुमान कोड को सार्वजनिक कर दिया गया है, जिससे एक ओपन सोर्स प्रवेश द्वार स्थापित हो गया है।

हल्के वजन बढ़ाने का चरण

डॉल्फिन-1.5: 2025-10-16 0.3बी आर्किटेक्चर को बनाए रखते हुए बेहतर पार्सिंग प्रदर्शन, यह दर्शाता है कि टीम ने पहले "हल्के प्रयोज्य" को पॉलिश किया है।

क्षमता विस्तार चरण

डॉल्फिन-वी2: 2025-12-12 को 3बी में अपग्रेड किया गया, जिसमें 21 नए तत्व का पता लगाना, विशेषता निष्कर्षण, फोटो दस्तावेज़ क्षमताएं, सूत्र और कोड विशेष विश्लेषण शामिल हैं। यह "हल्के और व्यावहारिक" से "अधिक सामान्य और मजबूत संरचना" तक का एक महत्वपूर्ण संस्करण है।

वर्तमान सीमा: वेयरहाउस में GitHub रिलीज़ तंत्र नहीं है, और संस्करण विकास README चेंजलॉग पर अधिक निर्भर करता है। यह मास्टर का आँख बंद करके अनुसरण करने के बजाय, एक्सेस करने से पहले कमिट या शाखाओं को पिन करने के लिए उपयुक्त है।

तकनीकी लाभ

बाइटडांस डॉल्फिन [आरएजी/नॉलेज बेस/डेटा सेंटर] और बुनियादी घटकों को पार्स करने वाले दस्तावेज़ का एक क्रॉस-प्रकार है। इसका मूल्यांकन यहां इसके मुख्य डिलीवरी फॉर्म "डॉक्यूमेंट पार्सिंग इंफ्रास्ट्रक्चर" द्वारा किया गया है।

डेटा सीमा: अधिकारी स्पष्ट रूप से डिजिटल-जन्मे और फोटोग्राफ किए गए दस्तावेज़ों दोनों पर विचार करता है, यह दर्शाता है कि यह न केवल पीडीएफ टेक्स्ट परत पर ध्यान केंद्रित करता है, बल्कि अधिक जटिल वास्तविक जीवन दस्तावेज़ छवियों को भी लक्षित करता है। लाभ यह है कि यह स्कैन किए गए दस्तावेज़ों और फोटो खींचे गए दस्तावेज़ों को संभाल सकता है; सीमा यह है कि अत्यधिक धुंधलापन, गंभीर परिप्रेक्ष्य विरूपण, और कम-रिज़ॉल्यूशन स्कैन अभी भी महत्वपूर्ण गुणवत्ता हानि का कारण बनेंगे।

दर्द बिंदुओं को याद करें: दस्तावेज़ पार्सिंग में वास्तविक कठिनाई न केवल चरित्र पहचान है, बल्कि बहुभाषी मिश्रण, पेशेवर शब्दावली, तालिकाओं का प्रसार, नेस्टेड सूत्र और लेआउट ब्रेक भी है। हालाँकि डॉल्फ़िन इन अनुभागों में पारंपरिक ओसीआर से अधिक मजबूत है, एक बार जब यह आरएजी या ज्ञान आधार लिंक में प्रवेश करता है, तब भी पुनर्प्राप्ति पूर्वाग्रह को कम करने के लिए हाइब्रिड खोज, मेटाडेटा फ़िल्टरिंग और पेज-स्तर और तत्व-स्तर मिश्रित चंकिंग का उपयोग करने की अनुशंसा की जाती है।

सुरक्षा अनुपालन: आधिकारिक सार्वजनिक गोदाम आरबीएसी, किरायेदार अलगाव जैसी उद्यम प्रशासन जानकारी का खुलासा नहीं करता है, और क्या डेटा का उपयोग माध्यमिक प्रशिक्षण के लिए किया जाता है। ओपन सोर्स स्व-परिनियोजन का सबसे बड़ा लाभ यह है कि डेटा नियंत्रणीय है, लेकिन सबसे बड़ी लागत यह है कि इन शासन क्षमताओं को स्वयं द्वारा पूरक किया जाना चाहिए।

कैसे उपयोग करें

आधिकारिक भंडार ने मुख्य स्थापना और तर्क पथ प्रदान किए हैं।

गिट क्लोन https://github.com/ByteDance/Dolphin.git
सीडी डॉल्फिन
पिप इंस्टॉल -आर आवश्यकताएँ.txt
गिट एलएफएस स्थापित करें
गिट क्लोन https://huggingface.co/ByteDance/Dolphin-v2 ./hf_model
पायथन डेमो_पेज.py --मॉडल_पथ ./hf_model --save_dir ./results --input_path ./demo/page_imgs/page_1.png

प्रवेश विवरण:

कैसे उपयोग करें किसके लिए उपयुक्त निर्देश
demo_page.py टीम जो पूर्ण पृष्ठ पार्सिंग करती है पृष्ठ-स्तरीय संरचना परिणाम सीधे आउटपुट करें
demo_element.py टीम बारीक तत्व निष्कर्षण कर रही है तालिकाओं, सूत्रों और कोडों के अलग-अलग प्रसंस्करण के लिए उपयुक्त
demo_layout.py एक टीम जो लेआउट समझ और पूर्व-विश्लेषण करती है प्री-लेआउट निदान के लिए उपयुक्त

मानव-कंप्यूटर सहयोग की सीमा: बैच निष्कर्षण को स्वचालित किया जा सकता है, लेकिन उच्च-मूल्य वाले अनुबंधों, चिकित्सा दस्तावेजों, वित्तीय विवरणों और जटिल शैक्षणिक पीडीएफ की अभी भी ऑनलाइन होने से पहले मनुष्यों द्वारा समीक्षा की जानी चाहिए, तालिका संरेखण, लापता सूत्रों और टूटे हुए क्रॉस-पेज संबंधों पर ध्यान केंद्रित किया जाना चाहिए।

उत्पाद का मूल्य निर्धारण

सार्वजनिक मूल्य निर्धारण मौजूद नहीं है क्योंकि यह एक खुला स्रोत मॉडल है, ऑफ-द-शेल्फ SaaS नहीं।

सी-साइड/व्यक्तिगत: सामान्य उपयोगकर्ताओं के लिए कोई खरीदारी प्रवेश द्वार नहीं है।

डेवलपर/एपीआई: सबसे महत्वपूर्ण लागत मॉडल डाउनलोड, अनुमान परिनियोजन, ग्राफिक्स मेमोरी और थ्रूपुट अनुकूलन हैं।

उद्यम: यदि आप एक आंतरिक विश्लेषण प्लेटफ़ॉर्म बनाना चाहते हैं, तो तर्क की लागत के अलावा, आपको अनुमतियाँ, कैशिंग, कार्य कतार, परिणाम सत्यापन और लॉग प्रबंधन भी शामिल करना होगा।

मुक्त सत्य: ओपन सोर्स लाइसेंस फीस बचाता है, सिस्टम लागत नहीं। एक बार जब दस्तावेज़ विश्लेषण उत्पादन तक पहुंच जाता है, तो कंप्यूटिंग शक्ति और डेटा प्रबंधन को कभी भी नजरअंदाज नहीं किया जाएगा।

अनुप्रयोग परिदृश्य

  • ज्ञान आधार पूर्व-प्रसंस्करण: पहले पीडीएफ, रिपोर्ट और कागजात की संरचना करें, और फिर उन्हें पुनर्प्राप्ति और प्रश्नोत्तर लिंक पर भेजें।
  • शैक्षणिक दस्तावेज़ और सूत्र विश्लेषण: मिश्रित सूत्रों, तालिकाओं और पाठ के साथ वैज्ञानिक अनुसंधान सामग्री के लिए विशेष रूप से उपयुक्त।
  • एंटरप्राइज़ दस्तावेज़ डिजिटलीकरण: अनुबंधों, तकनीकी दस्तावेज़ों और व्यावसायिक रिपोर्टों का संरचित निष्कर्षण।
  • मल्टी-पेज पीडीएफ बैच प्रोसेसिंग: बड़ी मात्रा में ऐतिहासिक दस्तावेजों को इंडेक्सेबल, डाउनस्ट्रीम-उपभोज्य संरचित डेटा में परिवर्तित करें।

आयामीता में कमी स्ट्राइक परिदृश्य: जब तालिकाओं, सूत्रों और पढ़ने के क्रम के मुद्दों के कारण टीम को पारंपरिक ओसीआर द्वारा गंभीर रूप से प्रताड़ित किया गया है, तो इसका उपयोग करने से संरचनात्मक गुणवत्ता में बहुत स्पष्ट सुधार होगा।

वर्तमान सीमाएँ: यदि किसी व्यवसाय को केवल सादे टिकट ओसीआर या एकल-स्तंभ दस्तावेज़ पाठ निष्कर्षण की आवश्यकता है, तो उच्च इंजीनियरिंग जटिलता के कारण यह आवश्यक रूप से सबसे अधिक लागत प्रभावी विकल्प नहीं हो सकता है।

लागू लोग

  • प्लेटफ़ॉर्म टीम ज्ञान आधार/आरएजी पर काम कर रही है: उच्च गुणवत्ता वाले दस्तावेज़ प्रीप्रोसेसिंग की आवश्यकता है।
  • दस्तावेज़ एआई उत्पाद टीम: ओसीआर को सादे पाठ पहचान से संरचना समझ में अपग्रेड करना चाहते हैं।
  • अनुसंधान और शिक्षा टीम: कागजात, पाठ्यपुस्तकों, परीक्षण पत्रों और सूत्रों वाली सामग्रियों से निपटते समय अधिक मूल्यवान।

अनुनय परिदृश्य:

  • जो लोग केवल कम-अवरोधक आउट-ऑफ-द-बॉक्स उपयोग चाहते हैं: यह मॉडल घटकों की तरह है, न कि ऑफ-द-शेल्फ SaaS की तरह।
  • जीपीयू या मॉडल परिनियोजन अनुभव के बिना टीमें: परिनियोजन और त्वरण कॉन्फ़िगरेशन बहुत सारी बाधाएं लाएगा।
  • इसे एक "सार्वभौमिक और त्रुटि-मुक्त ओसीआर" टीम के रूप में सोचें: जटिल दस्तावेज़ विश्लेषण के लिए अभी भी यादृच्छिक निरीक्षण और डाउनस्ट्रीम सुधार की आवश्यकता होती है।

सारांश और आउटलुक

बाइटडांस डॉल्फिन की प्रतिस्पर्धात्मकता दस्तावेज़ समझ को "पूर्ण पृष्ठ साक्षरता" से "संरचना पहले, सामग्री बाद में" तक आगे बढ़ाने की क्षमता में निहित है। यह ज्ञान के आधारों, उद्यम दस्तावेजों और अनुसंधान सामग्री प्रसंस्करण के लिए महत्वपूर्ण है, क्योंकि जो वास्तव में डाउनस्ट्रीम प्रयोज्य को निर्धारित करता है वह अक्सर चरित्र सटीकता नहीं है, लेकिन क्या तालिकाएं, सूत्र, कोड ब्लॉक और पढ़ने का क्रम सही रहता है।

[खरीद/गोद लेने का जोखिम मूल्यांकन]: गोद लेने से पहले मूल्यांकन करने वाली सबसे महत्वपूर्ण बात केवल सूची स्कोर को देखने के बजाय आपके दस्तावेज़ का प्रकार है। यदि बड़ी संख्या में दस्तावेज़ जटिल शैक्षणिक पीडीएफ, बहु-पृष्ठ रिपोर्ट, मिश्रित तालिकाएँ और सूत्र हैं, तो डॉल्फ़िन मूल्यवान है; यदि यह केवल हल्का टेक्स्ट ओसीआर है, तो "अतिक्षमता और अतिइंजीनियरिंग" की समस्या उत्पन्न हो सकती है। भविष्य में जो देखने लायक है वह है v2 का अनुवर्ती अनुमान त्वरण पारिस्थितिकी तंत्र, फोटोग्राफ किए गए दस्तावेज़ों की स्थिरता, और स्कीमा मानकीकरण और उद्यम प्रशासन के आसपास समुदाय की पुनःपूर्ति की गति।

संस्करण जानकारी

  • डॉल्फिन-वि.2 :आधिकारिक वेयरहाउस चेंजलॉग में बताए गए नवीनतम मेनलाइन संस्करण को 3बी पैरामीटर में अपग्रेड किया गया है, जिसमें 21 प्रकार के तत्व पहचान, विशेषता फ़ील्ड निष्कर्षण, विशेष सूत्र और कोड विश्लेषण और मजबूत फोटो दस्तावेज़ प्रसंस्करण क्षमताएं शामिल हैं।
  • डॉल्फिन-1.5 :0.3बी हल्के आर्किटेक्चर को बनाए रखते हुए पार्सिंग प्रभाव में महत्वपूर्ण सुधार करना पहले संस्करण से व्यावहारिक उपयोग की ओर बढ़ने में एक महत्वपूर्ण नोड है।
  • डॉल्फिन 1.0 :अधिकारी ने पहली बार प्री-ट्रेनिंग मॉडल और अनुमान कोड का खुलासा किया, दस्तावेज़ पार्सिंग के लिए एक पूर्ण ओपन सोर्स प्रवेश द्वार की स्थापना की।

उपयोगकर्ता समीक्षाएं

  • समीक्षाएं लोड हो रही हैं...