डीपसीक छवि पहचान मोड आधिकारिक तौर पर लॉन्च किया गया है: मल्टी-मोडल क्षमताओं के उत्पादीकरण की दिशा में एक महत्वपूर्ण कदम

डीपसीक का इमेज रिकग्निशन मोड आधिकारिक तौर पर वेब और ऐप पर लॉन्च किया गया है, जिसमें "क्विक मोड" और "एक्सपर्ट मोड" के साथ थिंकिंग विद विज़ुअल प्रिमिटिव फ्रेमवर्क का उपयोग किया गया है, जो अनुसंधान और विकास से उत्पादीकरण तक मल्टी-मोडल क्षमताओं के संक्रमण को चिह्नित करता है।

डीपसीक मल्टी-मोडल शोधकर्ता ज़ियाओकांग चेन ने घोषणा की कि डीपसीक का इमेज रिकग्निशन मोड आधिकारिक तौर पर वेब और ऐप पर लॉन्च किया गया है। "इमेज रीडिंग मोड" को "क्विक मोड" और "एक्सपर्ट मोड" के साथ जोड़ा गया है। चालू होने पर, उपयोगकर्ता दृश्य सामग्री को समझने के लिए डीपसीक के लिए सीधे छवियां अपलोड कर सकते हैं। इसकी क्षमताएं सरल पाठ निष्कर्षण (ओसीआर) से अधिक हैं।

डीपसीक छवि पहचान मोड

इस छवि पहचान मोड के लॉन्च के लिए अंतर्निहित प्रौद्योगिकी ढांचा इस साल अप्रैल में डीपसीक द्वारा जारी "थिंकिंग विद विजुअल प्रिमिटिव्स" कोर फ्रेमवर्क है। फ्रेमवर्क का मुख्य विचार मॉडल को मनुष्यों की तरह तर्क के लिए दृश्य जानकारी को "आदिम" में विघटित करने की अनुमति देना है, न कि छवियों को केवल एंड-टू-एंड टेक्स्ट में मैप करना। यह तकनीकी मार्ग घरेलू मल्टी-मॉडल मॉडलों के बीच अद्वितीय है।

दृश्य आदिम ढांचा

इमेज रिकग्निशन मोड का लॉन्च डीपसीक के लिए "शुद्ध टेक्स्ट रीजनिंग के राजा" से "मल्टी-मोडल ऑल-राउंड प्लेयर" की ओर बढ़ने के लिए एक महत्वपूर्ण कदम है। पहले, डीपसीक की मुख्य प्रतिस्पर्धात्मकता गणितीय तर्क, कोड पीढ़ी और लंबी पाठ प्रसंस्करण पर केंद्रित थी, और इसकी दृश्य क्षमताएं हमेशा डौबाओ जैसे प्रतिस्पर्धी उत्पादों के साथ प्रतिस्पर्धा में इसकी स्पष्ट कमियां रही हैं।

जिस दिन इसे लॉन्च किया गया था, उस दिन एक नाटकीय प्रकरण भी था - द पेपर के अनुसार, डीपसीक का छवि पहचान मोड संस्थापक लियांग वेनफेंग की तस्वीरों को सही ढंग से पहचानने में असमर्थ था, बल्कि इसकी पहचान डोंग युहुई, झांग ज़ुएफ़ेंग और यहां तक ​​​​कि लेई जून के रूप में की गई थी। लेई जून की तस्वीर की सटीक पहचान की गई थी। एक स्पष्टीकरण यह है कि लिआंग वेनफेंग बेहद कम महत्वपूर्ण कार्य करता है, और इंटरनेट पर कुछ सार्वजनिक तस्वीरें और जानकारी हैं, जिससे मॉडल के लिए स्थिर पहचान सुविधाओं को बनाना मुश्किल हो जाता है। यह "बॉस को न जानना" ऊलोंग सिर्फ यह साबित करता है कि डीपसीक ने अपने बॉस के लिए विशेष पहचान अनुकूलन नहीं किया है - मॉडल की चेहरा पहचानने की क्षमता सार्वजनिक प्रशिक्षण डेटा के वितरण पर आधारित है, न कि आंतरिक विशेषाधिकारों पर।

इस छवि पहचान मोड की आधिकारिक रिलीज़, V4 श्रृंखला मॉडल के समग्र उन्नयन के साथ मिलकर, डीपसीक की मल्टी-मोडल पहेली को पूरा करती है। भविष्य में ध्यान देने योग्य बात यह है कि क्या वास्तविक दृश्यों में दृश्य समझ का प्रदर्शन V4 श्रृंखला की तर्क क्षमताओं के समान स्तर तक पहुंच सकता है, और क्या यह V4.1 में नियोजित मल्टी-मोडल संस्करण के साथ ओवरलैप होगा।

कॉपीराइट: सामग्री स्रोत यह घर । इस प्लेटफॉर्म ने सूचना प्रसार और सीखने के आदान-प्रदान के उद्देश्य से इस सामग्री को संकलित और व्यवस्थित किया है। कॉपीराइट संबंधी चिंताओं के लिए कृपया हमसे संपर्क करें।

समीक्षाएं

  • समीक्षाएं लोड हो रही हैं...