OpenClaw AI सामग्री संग्रह का गहन समाधान
🛒 डेटा इंजीनियरों और शोधकर्ताओं के लिए ओपनक्लॉ एआई इन-डेप्थ एप्लिकेशन समाधान एआई इंटेलिजेंट क्रॉलिंग, डायनेमिक पेज पार्सिंग, संरचित डेटा निष्कर्षण, एंटी-क्रॉलिंग रणनीति प्रतिक्रिया, डेटा सफाई और डीडुप्लीकेशन, और अनुसूचित संग्रह कार्य ऑर्केस्ट्रेशन जैसे मुख्य परिदृश्यों को कवर करता है।
OpenClaw AI सामग्री संग्रह गहराई समाधान
समाधान सिंहावलोकन
इस समाधान द्वारा हल की गई मुख्य समस्या: "लक्ष्य पहचान → बुद्धिमान क्रॉलिंग → गतिशील पार्सिंग → संरचित निष्कर्षण → डेटा सफाई → अनुसूचित ऑर्केस्ट्रेशन" से एक पूर्ण सामग्री संग्रह पाइपलाइन बनाने के लिए
यह समाधान हल नहीं करता: बड़े पैमाने पर वितरित क्रॉलर क्लस्टर का शेड्यूलिंग और संसाधन प्रबंधन, अत्यधिक एंटी-क्रॉलिंग परिदृश्य जिनके लिए ब्राउज़र फ़िंगरप्रिंट रोटेशन की आवश्यकता होती है, और उच्च-आवृत्ति डेटा पाइपलाइन जिन्हें वास्तविक समय स्ट्रीमिंग प्रसंस्करण की आवश्यकता होती है।
लक्षित उपयोगकर्ता: डेटा इंजीनियर, बाजार शोधकर्ता, अकादमिक शोधकर्ता, सामग्री संचालन कर्मी - कोई भी भूमिका जिसे वेब पेजों से लगातार संरचित डेटा प्राप्त करने की आवश्यकता होती है लेकिन वह पारंपरिक क्रॉलर रखरखाव के दलदल में फंसना नहीं चाहता है।
तकनीकी आवश्यकताएँ:
- बुनियादी कमांड लाइन संचालन क्षमताएं रखें (कमांड निष्पादित करने के लिए टर्मिनल का उपयोग कर सकते हैं)
- कम से कम एक एलएलएम एपीआई कुंजी प्राप्त करने में सक्षम हो (ओपनएआई / एंथ्रोपिक / स्थानीय मॉडल स्वीकार्य है)
- लक्ष्य वेबसाइट को ब्राउज़र के माध्यम से सामान्य रूप से एक्सेस किया जा सकता है (कोई कॉर्पोरेट इंट्रानेट या आईपी श्वेतसूची प्रतिबंध नहीं)
कार्यक्रम के मुख्य लाभ:
- पारंपरिक क्रॉलर विकास में "पार्सिंग नियम लिखने → XPath/CSS चयनकर्ताओं को बनाए रखने → वेबसाइट संशोधनों को संभालने" के कठिन काम को "प्राकृतिक भाषा विवरण → एआई स्वचालित रूप से पृष्ठ संरचना → अनुकूली निष्कर्षण" की एक बुद्धिमान प्रक्रिया में संपीड़ित करें।
- जावास्क्रिप्ट रेंडरिंग (एसपीए), आलसी लोडिंग, गतिशील सामग्री इंजेक्शन और अन्य पेज प्रकारों को स्वाभाविक रूप से हल करने के लिए ओपनक्लाव की ब्राउज़र नियंत्रण क्षमताओं का उपयोग करें जिन्हें पारंपरिक HTTP अनुरोध क्रॉलर संभाल नहीं सकते हैं।
- एक एकल ओपनक्लॉ एजेंट कई उपकरणों के बीच डेटा को स्थानांतरित करने की आवश्यकता को समाप्त करते हुए, संग्रह, सफाई, डिडुप्लीकेशन और आउटपुट की पूरी श्रृंखला को पूरा कर सकता है।
टूलचेन सूची
| उपकरण | उद्देश्य | आवश्यक खाता स्तर | अनुमानित फीस | विकल्प |
|---|---|---|---|---|
| OpenClaw | कोर इंजन: ब्राउज़र नियंत्रण, डेटा निष्कर्षण, समय ऑर्केस्ट्रेशन | मुफ़्त (एमआईटी) | $0 + एलएलएम एपीआई शुल्क | नाटककार + स्वनिर्मित पटकथा |
| <एक्सलिंक प्रकार = "टूल" स्लग = "क्लाउड" नाम = "क्लाउड"> | रणनीति डिजाइन, पार्सिंग नियम निर्माण, डेटा विश्लेषण | मुफ़्त/प्रो $20/माह | जाते ही भुगतान करें बिलिंग | चैटजीपीटी/डीपसीक |
| वैकल्पिक एलएलएम, डेटा गुणवत्ता ऑडिट | मुफ़्त/प्लस $20/माह | ऑन-डिमांड बिलिंग | क्लाउड/मिथुन | |
| <एक्सलिंक प्रकार = "टूल" स्लग = "ब्राउज़रबेस" नाम = "ब्राउज़रबेस"> | क्लाउड ब्राउज़र सत्र प्रबंधन और समवर्ती क्रॉलिंग | निःशुल्क टियर/भुगतान | जाते ही भुगतान करें बिलिंग | नाटककार एमसीपी |
| Jina AI | वेब पेज जल्दी से प्राप्त करने के लिए रीडर एपीआई मार्कडाउन | निःशुल्क टियर/भुगतान | जाते ही भुगतान करें बिलिंग | फायरक्रॉल |
| पायथन | डेटा सफाई स्क्रिप्ट और पोस्ट-प्रोसेसिंग | मुफ़्त | $0 | जावास्क्रिप्ट/नोड.जेएस |
तैयारी
आधिकारिक लॉन्च से पहले, निम्नलिखित तैयारी पूरी करें:
पर्यावरण विन्यास
- [ ] ओपनक्लाव स्थापित करें:
कर्ल -एफएसएसएल https://openclaw.ai/install.sh | बैश - [ ] प्रारंभिक बूट को पूरा करने के लिए
openclaw initनिष्पादित करें - [ ] एलएलएम एपीआई कुंजी कॉन्फ़िगर करें (जटिल पृष्ठ समझ के लिए क्लाउड या जीपीटी-4ओ श्रृंखला की सिफारिश की जाती है)
- [ ] सत्यापित करें कि
ओपनक्ला चैटटर्मिनल वार्तालाप सामान्य रूप से प्रतिक्रिया करता है
लक्ष्य परिभाषा
- [ ] संग्रह लक्ष्य स्पष्ट करें: साइट यूआरएल सूची, संग्रह फ़ील्ड परिभाषा, अद्यतन आवृत्ति
- [ ] लक्ष्य साइट की robots.txt अनुपालन आवश्यकताओं और उपयोग की शर्तों की पुष्टि करें
- [ ] डेटा आउटपुट प्रारूप सेट करें (JSON / CSV / मार्कडाउन / डेटाबेस)
सुरक्षा आधार रेखा
- [ ] अपरिवर्तनीय संचालन (फ़ाइल हटाना, सामग्री प्रकाशन) के लिए मैन्युअल पुष्टिकरण बिंदु सक्षम करें
- [ ] यदि इसका उपयोग केवल संग्रह के लिए किया जाता है, तो इसे
केवल पढ़ने के लिए: सत्यकेवल पढ़ने के लिए मोड को कॉन्फ़िगर करने की अनुशंसा की जाती है - [ ] अनंत लूप को रोकने के लिए
max_steps(अनुशंसित 25-50) औरmax_tokens_per_taskबजट कॉन्फ़िगर करें
चरण-दर-चरण मार्गदर्शिका
चरण 1: संग्रह रणनीति डिज़ाइन और लक्ष्य मॉडलिंग
⏱अनुमानित समय: 1-2 घंटे 🎯लक्ष्य: फ़ज़ी संग्रह आवश्यकताओं को ओपनक्लाव निष्पादन योग्य एजेंट कमांड टेम्पलेट में परिवर्तित करें ⚠️ पूर्वावश्यकताएँ: पर्यावरण स्थापना पूर्ण
ऑपरेशन निर्देश
संग्रह रणनीति संपूर्ण पाइपलाइन की नींव है - क्या क्रॉल करना है, कहां क्रॉल करना है, कैसे क्रॉल करना है और क्रॉल करने के बाद क्या करना है, इसे परिभाषित करने के लिए कोड के बजाय प्राकृतिक भाषा का उपयोग करना। पारंपरिक क्रॉलर को XPath/CSS चयनकर्ता लिखने की आवश्यकता होती है, लेकिन OpenClaw LLM के माध्यम से पेज शब्दार्थ को समझ सकता है। इसलिए, रणनीति डिज़ाइन की कुंजी "स्पष्ट रूप से बताएं कि आप क्या चाहते हैं" के बजाय "स्पष्ट रूप से लिखें कि कैसे चयन करें।"
विशिष्ट संचालन
- लक्षित साइटों और संग्रह क्षेत्रों की सूची बनाएं: प्रत्येक लक्ष्य साइट को एक संग्रह कॉन्फ़िगरेशन के रूप में रिकॉर्ड करें, जिसमें साइट यूआरएल, संग्रह पृष्ठ प्रकार (सूची पृष्ठ/विवरण पृष्ठ/खोज पृष्ठ), और उन फ़ील्ड की सूची शामिल है जिन्हें निकालने की आवश्यकता है (शीर्षक, समय, लेखक, पाठ, लिंक, आदि)।
- संग्रह ट्रिगर शर्तों को परिभाषित करें: सामग्री में परिवर्तन होने पर एकमुश्त संग्रह/क्रॉन द्वारा नियमित अद्यतन/वृद्धिशील संग्रह।
- एजेंट कमांड टेम्पलेट लिखें: संग्रह प्रक्रिया का वर्णन करने के लिए प्राकृतिक भाषा का उपयोग करें, उदाहरण के लिए:
"प्रत्येक समाचार का शीर्षक, प्रकाशन समय और सारांश लिंक निकालने के लिए https://example.com/news पर जाएं।
संपूर्ण पाठ और लेखक की जानकारी निकालने के लिए प्रत्येक लिंक के विवरण पृष्ठ पर जाएँ।
सभी डेटा को JSON प्रारूप में ~/collected_data/news_{date}.json" में सहेजें
- डिज़ाइन डेटा स्कीमा: बाद की सफाई के लिए तैयार करने के लिए आउटपुट फ़ील्ड का नाम, प्रकार और प्रारूप विनिर्देश निर्धारित करें।
विशेषज्ञ का दृष्टिकोण
इस चरण का पारंपरिक विकल्प पायथन स्क्रिप्ट लिखने के लिए स्क्रैपी/प्लेराइट का उपयोग करना है, और हर बार आवश्यकताएं बदलने पर, आपको कोड बदलना होगा, चयनकर्ता का परीक्षण करना होगा और अपडेट को तैनात करना होगा। "लेखन कोड" को "लेखन विवरण" से बदलने के लिए ओपनक्लाव के समाधान का उपयोग करते हुए, मांग पक्ष (जैसे शोधकर्ता और संचालन) विकास कार्यक्रम की प्रतीक्षा किए बिना सीधे रणनीति परिभाषा में भाग ले सकते हैं।
सत्यापन विधि
OpenClaw टर्मिनल में openclaw चैट निष्पादित करें और यह पुष्टि करने के लिए कि एजेंट संग्रह लक्ष्य को सही ढंग से समझता है, कमांड टेम्पलेट का सरलीकृत संस्करण (केवल एक पृष्ठ के लिए) दर्ज करें।
चरण 2: लक्ष्य पृष्ठ जागरूकता और डीओएम अनुकूलन
⏱अनुमानित समय: 1-2 घंटे 🎯लक्ष्य: पुष्टि करें कि OpenClaw का ब्राउज़र नियंत्रण लक्ष्य पृष्ठ को सही ढंग से प्रस्तुत कर सकता है और वैध सामग्री निकाल सकता है ⚠️पूर्व शर्त: रणनीति टेम्पलेट तैयार है
ऑपरेशन निर्देश
विभिन्न वेबसाइटों की पृष्ठ संरचनाएँ बहुत भिन्न होती हैं - एसपीए अनुप्रयोगों (जैसे कि रिएक्ट/व्यू के साथ निर्मित पृष्ठ) को जावास्क्रिप्ट रेंडरिंग के पूरा होने तक प्रतीक्षा करने की आवश्यकता होती है; स्क्रॉलिंग द्वारा छवियों और सूचियों की आलसी लोडिंग को ट्रिगर करने की आवश्यकता है; एंटी-क्रॉलिंग पृष्ठों को सत्यापन कोड या लॉगिन स्थिति संसाधित करने की आवश्यकता होती है। OpenClaw का ब्राउज़र नियंत्रण Playwright पर आधारित है और अधिकांश गतिशील पृष्ठों को संभाल सकता है, लेकिन इसके लिए पृष्ठ अनुकूलन और अनुकूलन की आवश्यकता होती है।
विशिष्ट संचालन
- पेज लोडिंग टेस्ट: लक्ष्य यूआरएल पर नेविगेट करने के लिए ओपनक्लाव के 'ब्राउज' टूल का उपयोग करें और देखें कि पेज पूरी तरह से लोड है या नहीं।
- DOM मोड चयन: OpenClaw तीन DOM इंजेक्शन मोड का समर्थन करता है -
पूर्ण(पूर्ण DOM ट्री),एक्सेसिबिलिटी(सुलभ ट्री, जटिल एसपीए के लिए अनुशंसित),विज़िबल(केवल दृश्य क्षेत्र)। डेटा संग्रह परिदृश्यों के लिए, टोकन खपत को कम करने के लिए 'पहुंच-योग्यता' मोड को प्राथमिकता दी जाती है:
# एजेंट कॉन्फ़िगरेशन में DOM मोड सेट करें
ओपनक्लॉ कॉन्फिग सेट एजेंट.डोम_मोड एक्सेसिबिलिटी
- पेज इंटरेक्शन अनुक्रम परिभाषा: उन साइटों के लिए जिन्हें लॉगिन, खोज और पेज टर्निंग की आवश्यकता होती है, ऑपरेशन चरणों का अनुक्रम डिज़ाइन करें (जैसे:
ब्राउज़ करें → खोज बॉक्स टाइप करें → खोज बटन पर क्लिक करें → परिणाम लोड होने की प्रतीक्षा करें → परिणाम सूची निकालें)। - निष्कर्षण सटीकता सत्यापन: फ़ील्ड अखंडता (कोई गायब फ़ील्ड नहीं) और सटीकता (कोई भ्रमित फ़ील्ड नहीं) की पुष्टि करने के लिए निष्कर्षण परिणामों को मैन्युअल रूप से सत्यापित करें।
विशेषज्ञ का दृष्टिकोण
DOM अनुकूलन सामग्री अधिग्रहण समाधानों का सबसे कम आंका गया पहलू है। पारंपरिक क्रॉलर में, वेबसाइट के फ्रंट-एंड पुनर्निर्माण के कारण सभी चयनकर्ता अमान्य हो सकते हैं, और अनुरक्षक को DOM नोड्स को स्थानांतरित करने की आवश्यकता होती है। OpenClaw की अर्थ निष्कर्षण विधि (एलएलएम निश्चित चयनकर्ताओं के बजाय पृष्ठ सामग्री को समझती है) पृष्ठ संरचना में परिवर्तनों के लिए स्वाभाविक रूप से प्रतिरोधी है - जब तक कि पृष्ठ सामग्री स्वयं बहुत अधिक नहीं बदलती है, तब भी एआई सभी सीएसएस वर्ग के नाम बदलने पर भी सही ढंग से जानकारी निकाल सकता है। पारंपरिक क्रॉलर की तुलना में यह इस समाधान का मुख्य स्थायित्व लाभ है।
सत्यापन विधि
एकल पृष्ठ के लिए, OpenClaw त्रुटि मिश्रण के बिना सभी लक्ष्य फ़ील्ड को सही ढंग से निकाल सकता है, और फ़ील्ड अखंडता ≥ 95% है।
चरण 3: बुद्धिमान क्रॉलिंग कार्यों को लिखना और निष्पादित करना
⏱अनुमानित समय: 2-4 घंटे 🎯लक्ष्य: एकल पृष्ठ सत्यापन को निष्पादन योग्य बहु-पृष्ठ संग्रह एजेंट कार्यों में पास करने वाले संग्रह निर्देशों का विस्तार करें ⚠️ पूर्वावश्यकता: एकल पृष्ठ अनुकूलन सत्यापन उत्तीर्ण
ऑपरेशन निर्देश
ओपनक्लाव का कार्य निष्पादन एक सरल "ओपन → एक्सट्रैक्ट → सेव" अनुक्रम नहीं है, बल्कि एजेंट के स्वतंत्र निर्णय लेने की एक चक्रीय प्रक्रिया है: एलएलएम वर्तमान पृष्ठ की स्थिति को देखता है → अगला ऑपरेशन निर्धारित करता है → संबंधित टूल को कॉल करता है → परिणामों को देखता है → जारी रखने या समाप्त करने का निर्णय लेता है। यह "धारणा-निर्णय-निष्पादन" चक्र एजेंट को प्रत्येक शाखा तर्क को मैन्युअल रूप से लिखने की आवश्यकता के बिना, किनारे की स्थितियों जैसे पृष्ठ लोडिंग अपवाद, तत्वों का दिखाई न देना, पृष्ठ को अंतिम पृष्ठ पर मोड़ना आदि को संभालने की अनुमति देता है।
विशिष्ट संचालन
- संग्रह एजेंट कॉन्फ़िगरेशन फ़ाइल बनाएं:
OpenClaw कॉन्फ़िगरेशन निर्देशिका में संग्रह कार्य फ़ाइल ~/.openclaw/tasks/content_collector.yaml बनाएं:
नाम: "daily_news_collector"
मॉडल: क्लाउड-सॉनेट-4-5
अधिकतम चरण: 50
टाइमआउट: 120000
केवल पढ़ने योग्य: सत्य
उपकरण:
-ब्राउज़ करें
- क्लिक करें
-निकालें
- स्क्रीनशॉट
-रुको
-स्क्रॉल
-मूल्यांकन करें
शीघ्र: |
आपका कार्य निम्नलिखित साइटों से समाचार डेटा एकत्र करना और परिणामों को निर्दिष्ट फ़ाइल में सहेजना है।
संग्रह लक्ष्य:
1. https://example-news.com/technology पर जाएं
- सूची से लेख के शीर्षक, लिंक और सार निकालें
- विवरण पृष्ठ दर्ज करने और पाठ, लेखक और रिलीज़ समय निकालने के लिए प्रत्येक लिंक पर क्लिक करें
2. https://example-blog.com/blog पर जाएं
- जब तक कोई नई सामग्री न हो तब तक अधिक लेख लोड करने के लिए स्क्रॉल करें
- प्रत्येक लेख का शीर्षक, श्रेणी और प्रकाशन तिथि निकालें
आउटपुट प्रारूप: JSON सरणी, प्रत्येक आइटम में {स्रोत, शीर्षक, यूआरएल, लेखक, प्रकाशित_एट, सामग्री, सारांश} शामिल है
आउटपुट पथ: ~/collect_data/technology_news_{today}.json
आउटपुट एन्कोडिंग: UTF-8
-
संग्रहण कार्य निष्पादित करें:
ओपनक्लॉ कार्य दैनिक_न्यूज़_कलेक्टर चलाएँ -
निष्पादन प्रक्रिया की निगरानी करें: निष्पादन के दौरान, ओपनक्लॉ वास्तविक समय में टर्मिनल पर एजेंट की सोच प्रक्रिया और टूल कॉल लॉग को आउटपुट करेगा। देखें कि क्या कोई अनंत लूप है (एजेंट पेज को बदले बिना बार-बार एक ही ऑपरेशन करता है), संदर्भ ओवरफ्लो (डीओएम बहुत लंबा है, जिससे टोकन सीमा से अधिक हो जाता है), या पेज लोडिंग टाइमआउट हो जाता है।
-
ब्रेकप्वाइंट से अधिग्रहण फिर से शुरू करें: यदि नेटवर्क रुकावट या टोकन बजट समाप्ति के कारण संग्रह निष्पादन समाप्त हो गया है, तो यह पुष्टि करने के लिए कुछ आउटपुट फ़ाइलों की जांच करें कि एकत्रित डेटा पूरा हो गया है या नहीं, फिर लक्ष्य साइट का दायरा कम करें और फिर से निष्पादित करें।
विशेषज्ञ का दृष्टिकोण
एजेंट स्वायत्त क्रॉलिंग और पारंपरिक क्रॉलर कार्यक्रमों के बीच डिज़ाइन दर्शन में बुनियादी अंतर हैं। पारंपरिक क्रॉलर "नियतात्मक प्रक्रियाएं" हैं: यदि पेज ए के लिए एक्सट्रैक्टर चरण 3 में विफल हो जाता है, तो पूरी प्रक्रिया बाधित हो जाती है। ओपनक्लॉ एजेंट एक "लक्ष्य-उन्मुख प्रक्रिया" है: भले ही किसी लिंक पर क्लिक किया जाता है और यह 404 पृष्ठ का पाया जाता है, एजेंट अपने आप ही "यह पृष्ठ अमान्य है" का निर्णय करेगा, छोड़ देगा और अगले लिंक को संसाधित करना जारी रखेगा। वास्तविक संग्रह परिदृश्यों में यह दोष सहिष्णुता अत्यंत मूल्यवान है - इंटरनेट पर किसी भी वेबसाइट की पृष्ठ गुणवत्ता अस्थिर है, और एजेंट की स्वायत्त निर्णय लेने की क्षमता "एक बार की स्क्रिप्ट" को पहले अपवाद का सामना करने पर पूरी तरह से ध्वस्त होने से रोक सकती है।
सत्यापन विधि
संग्रह कार्य पूरी तरह से निष्पादित हो गया है, आउटपुट फ़ाइल मौजूद है और सही प्रारूप में है। मैन्युअल सत्यापन के लिए कम से कम 20 रिकॉर्ड के नमूने निकाले जाते हैं, और फ़ील्ड अखंडता ≥ 90% है।
चरण 4: डेटा सफ़ाई और डिडुप्लीकेशन
⏱अनुमानित समय: 2-3 घंटे 🎯लक्ष्य: कच्चे एकत्रित डेटा को स्वच्छ, संरचित और पुन: प्रयोज्य डेटा सेट में परिवर्तित करें ⚠️पूर्व शर्त: कच्चा एकत्रित डेटा तैयार किया गया है
ऑपरेशन निर्देश
मूल एकत्र किए गए डेटा में आमतौर पर निम्नलिखित समस्याएं होती हैं: (1) शोर वाले HTML जैसे नेविगेशन बार, विज्ञापन, फ़ुटर इत्यादि पाठ में मिश्रित हो जाते हैं; (2) एक ही सामग्री को कई बार एकत्र किया जाता है (जैसे पेजिंग संग्रह के कारण ओवरलैप); (3) फ़ील्ड-स्तरीय गंदा डेटा जैसे असंगत दिनांक प्रारूप और अनावश्यक वर्णों वाले लेखक के नाम। यह चरण सफाई पूरी करने के लिए OpenClaw की शैल निष्पादन क्षमताओं और पायथन पोस्ट-प्रोसेसिंग स्क्रिप्ट का उपयोग करता है।
विशिष्ट संचालन
- पायथन सफाई स्क्रिप्ट लिखें (प्रारंभिक संस्करण उत्पन्न करने के लिए क्लाउड/चैटजीपीटी का उपयोग करें और फिर इसे ठीक करें):
# क्लीन_कलेक्टेड_डेटा.py
json आयात करें
पुनः आयात करें
पाथलिब आयात पथ से
डीईएफ़ क्लीन_कंटेंट(पाठ):
"""सामान्य वेब पेज शोर वाले टेक्स्ट को हटाएं"""
#अतिरिक्त रिक्त स्थान हटाएँ
टेक्स्ट = re.sub(r'\s+', '', text).strip()
# सामान्य फ़ुटर पैटर्न हटाएँ
शोर_पैटर्न = [
r'कॉपीराइट ©.*?\d{4}.*?\n',
आर'सर्वाधिकार सुरक्षित',
r'कृपया हमारे WeChat सार्वजनिक खाते का अनुसरण करें',
r'अगला लेख.*?\n',
r'पिछला लेख.*?\n',
]
शोर_पैटर्न में पैटर्न के लिए:
पाठ = पुनः.उप(पैटर्न, '', पाठ, झंडे=पुनः IGNORECASE)
वापसी पाठ.पट्टी()
डीईएफ़ डिडुप्लिकेट(रिकॉर्ड, कुंजी='शीर्षक'):
"""निर्दिष्ट फ़ील्ड के आधार पर डिडुप्लीकेशन, रिकॉर्ड की पहली घटना को बनाए रखना""
देखा = सेट()
अद्वितीय = []
अभिलेखों में पुनः प्राप्त करने के लिए:
वैल = rec.get(कुंजी, '').स्ट्रिप().निचला()
यदि वैल और वैल दिखाई नहीं दे रहे हैं:
देखा.जोड़ें(वैल)
अद्वितीय.जोड़ें(रिक)
अद्वितीय वापसी
डीईएफ़ सामान्यीकरण_दिनांक(दिनांक_str):
"""कई दिनांक प्रारूपों को YYYY-MM-DD में एकीकृत करने का प्रयास करें""
# इसे वास्तविक डेटा के आधार पर समायोजित करने की आवश्यकता है
वापसी दिनांक_str
यदि __नाम__ == '__मुख्य__':
इनपुट_पथ = पथ('~/collect_data/raw_news.json').expanduser()
आउटपुट_पथ = पथ('~/collect_data/cleaned_news.json').expanduser()
f के रूप में open(input_path, 'r', encoding='utf-8') के साथ:
डेटा = json.load(f)
# साफ़
डेटा में आइटम के लिए:
आइटम['सामग्री'] = क्लीन_कंटेंट(आइटम.गेट('सामग्री', ''))
आइटम['published_at'] = सामान्यीकृत_दिनांक(आइटम.get('published_at', ''))
# डुप्लिकेट हटाएं
डेटा = डुप्लिकेट (डेटा, कुंजी = 'शीर्षक')
f के रूप में open(output_path, 'w', encoding='utf-8') के साथ:
json.dump(डेटा, f,सुनिश्चित_ascii=गलत, इंडेंट=2)
print(f"साफ़ किया गया: {len(data)} रिकॉर्ड {output_path} में सहेजा गया")
-
OpenClaw के माध्यम से सफाई करें:
ओपनक्लाव चैट "निष्पादित करें ~/scripts/clean_collected_data.py, और फिर सफाई परिणाम आंकड़ों की रिपोर्ट करें" -
गुणवत्ता नमूनाकरण: साफ किए गए डेटा सेट से यादृच्छिक रूप से 5-10 रिकॉर्ड चुनें, और सामग्री की अखंडता और प्रारूप की शुद्धता की मैन्युअल रूप से पुष्टि करें।
-
दृश्य अवलोकन (वैकल्पिक): यदि डेटा की मात्रा बड़ी है, तो आप ओपनक्लॉ से एक सरल सारांश रिपोर्ट तैयार कर सकते हैं - अधिग्रहणों की कुल संख्या, डिडुप्लीकेशन की संख्या, स्रोत वितरण, समय कवरेज।
विशेषज्ञ का दृष्टिकोण
डेटा सफ़ाई सामग्री संग्रह पाइपलाइन में सबसे आसानी से "छोड़ दिया गया" लिंक है, लेकिन बाद में इसका "दोगुना भुगतान" किया जाएगा। कई टीमें अपने संग्रह प्रयासों को क्रॉल करने में खर्च करती हैं, लेकिन डेटाबेस में प्रवेश करने के बाद, उन्हें पता चलता है कि 30% डेटा डुप्लिकेट है और 20% टेक्स्ट अप्रासंगिक सामग्री के साथ मिलाया गया है। ओपनक्लॉ समाधान में, सफाई स्क्रिप्ट को संग्रह एजेंट से अलग करने की सिफारिश की जाती है: संग्रह एजेंट "मूल डेटा प्राप्त करने" के लिए जिम्मेदार है, और सफाई स्क्रिप्ट "प्रयोग योग्य डेटा में प्रसंस्करण" के लिए जिम्मेदार है। चिंताओं का यह पृथक्करण एजेंट कॉन्फ़िगरेशन परिवर्तनों के कारण गलती से सफाई की गुणवत्ता को प्रभावित किए बिना सफाई तर्क को स्वतंत्र रूप से दोहराने की अनुमति देता है।
सत्यापन विधि
सफाई के बाद, डेटा में कोई डुप्लिकेट रिकॉर्ड नहीं है (शीर्षक या यूआरएल डिडुप्लीकेशन के आधार पर), पाठ में कोई स्पष्ट नेविगेशन/विज्ञापन अवशेष नहीं है, दिनांक प्रारूप एकीकृत है, और फ़ील्ड अखंडता ≥ 95% है।
चरण 5: विरोधी चढ़ाई प्रतिक्रिया और मजबूती सुदृढीकरण
⏱अनुमानित समय: लचीला, लक्ष्य वेबसाइट की एंटी-क्रॉलिंग तीव्रता पर निर्भर करता है 🎯लक्ष्य: सुनिश्चित करें कि संग्रह कार्यों को सामान्य एंटी-क्रॉलिंग तंत्र के सामने अभी भी स्थिरतापूर्वक निष्पादित किया जा सकता है ⚠️ पूर्वावश्यकता: मूल संग्रह प्रक्रिया पूरी हो चुकी है
ऑपरेशन निर्देश
सभी वेबसाइटें स्वचालित संग्रह का स्वागत नहीं करतीं। ओपनक्लाव का प्लेराइट-आधारित ब्राउज़र नियंत्रण अनुरोध हेडर डिटेक्शन (क्योंकि यह एक वास्तविक ब्राउज़र वातावरण है) के आधार पर सरल एंटी-क्रॉलिंग को बायपास कर सकता है, लेकिन यह अभी भी दर सीमित करने, सत्यापन कोड (कैप्चा), आईपी प्रतिबंध और जावास्क्रिप्ट चुनौतियों (जैसे क्लाउडफ्लेयर) जैसे तंत्र का सामना कर सकता है। यह कदम "सफलता और विरोधी चढ़ाई" को प्रोत्साहित करने के लिए नहीं है, बल्कि यह सुनिश्चित करने के लिए है कि समाधान में कानूनी अनुपालन के आधार पर बुनियादी मजबूती हो।
विशिष्ट संचालन
- दर नियंत्रण: एजेंट कमांड में ऑपरेशन अंतराल जोड़ें:
अगला चरण करने से पहले प्रत्येक ऑपरेशन के बाद 2-3 सेकंड प्रतीक्षा करें
यदि आप HTTP 429 (बहुत अधिक अनुरोध) का सामना करते हैं, तो 60 सेकंड के लिए रुकें और पुनः प्रयास करें।
प्रत्येक 50 पृष्ठ क्रॉल करने के बाद 30 सेकंड के लिए रुकें
-
सत्यापन कोड प्रोसेसिंग: ओपनक्लॉ में स्वयं कैप्चा को स्वचालित रूप से हल करने की क्षमता नहीं है। सत्यापन कोड का सामना करते समय:
- एजेंट स्वचालित रूप से एक स्क्रीनशॉट लेगा और सत्यापन कोड प्रश्न आपको वापस भेज देगा
- आप चैट चैनल में सत्यापन कोड देख और मैन्युअल रूप से दर्ज कर सकते हैं
- लंबे समय से चल रहे संग्रह कार्यों के लिए, किसी तृतीय-पक्ष कैप्चा समाधान सेवा (जैसे 2Captcha) से कनेक्ट करने की अनुशंसा की जाती है
-
सत्र और कुकी प्रबंधन: उन साइटों के लिए जिन्हें लॉगिन की आवश्यकता है, पहले ब्राउज़र में मैन्युअल रूप से लॉग इन करें और कुकीज़ निर्यात करें, और फिर उन्हें ओपनक्लाव के ब्राउज़र संदर्भ में कॉन्फ़िगर करें:
ओपनक्लॉ कॉन्फ़िगरेशन सेट ब्राउज़र.कुकीज़_पथ ~/.ओपनक्लाव/कुकीज़/target_site.json
- विफलता पुनः प्रयास रणनीति: एजेंट निर्देश में पुनः प्रयास तर्क को परिभाषित करें:
जब पृष्ठ खोलने में विफलता हो, तो 10 सेकंड प्रतीक्षा करें और पुनः प्रयास करें, अधिकतम 3 बार।
लगातार 3 विफलताओं के बाद, यूआरएल को छोड़ दिया जाएगा और विफलता लॉग में दर्ज किया जाएगा।
विशेषज्ञ का दृष्टिकोण
कई स्व-निर्मित क्रॉलर परियोजनाएं एंटी-क्रॉलिंग प्रक्रिया में बहुत सारे विकास संसाधनों (आईपी पूल, प्रॉक्सी रोटेशन, ब्राउज़र फिंगरप्रिंट सिमुलेशन) का निवेश करती हैं। OpenClaw का लाभ यह है कि यह एक वास्तविक ब्राउज़र चलाता है (HTTP लाइब्रेरी सिमुलेशन नहीं), जो स्वाभाविक रूप से टीएलएस फिंगरप्रिंट डिटेक्शन, यूजर-एजेंट डिटेक्शन और जावास्क्रिप्ट क्षमता डिटेक्शन जैसे सामान्य एंटी-क्रॉलिंग तरीकों से बचता है। अधिकांश छोटे और मध्यम आकार की संग्रह आवश्यकताओं (प्रति दिन हजारों पृष्ठ) के लिए, ओपनक्लॉ प्लस उचित दर नियंत्रण पर्याप्त है, और एक समर्पित प्रॉक्सी बुनियादी ढांचे के निर्माण की कोई आवश्यकता नहीं है। ब्राउज़रबेस के क्लाउड ब्राउज़र सत्र प्रबंधन पर केवल तभी विचार करने की आवश्यकता है यदि लक्ष्य वेबसाइट वाणिज्यिक-ग्रेड एंटी-क्रॉलिंग समाधान (जैसे अकामाई, डेटाडोम) का उपयोग करती है।
सत्यापन विधि
मैन्युअल हस्तक्षेप के बिना, संग्रह कार्य लक्ष्य वेबसाइट के एंटी-क्रॉलिंग तंत्र को ट्रिगर किए बिना 100+ पृष्ठ संग्रह को लगातार और स्थिर रूप से चला सकता है, या एंटी-क्रॉलिंग प्रतिक्रिया (धीमा/स्किपिंग/रिकॉर्डिंग विफलता) को सही ढंग से संभाल सकता है।
चरण 6: निर्धारित संग्रह और वृद्धिशील अद्यतन
⏱अनुमानित समय: 1-2 घंटे 🎯लक्ष्य: संग्रह कार्य को मैन्युअल ट्रिगरिंग के बिना निर्धारित समय के अनुसार स्वचालित रूप से चलने दें ⚠️पूर्व शर्ते: संग्रह प्रक्रिया को सत्यापित किया गया है और एंटी-क्रॉलिंग रणनीति के वैध होने की पुष्टि की गई है।
ऑपरेशन निर्देश
सामग्री संग्रह का वास्तविक मूल्य "एक बार" के बजाय "निरंतर" में निहित है। OpenClaw का हार्टबीट सिस्टम (हार्टबीट) और क्रॉन शेड्यूलिंग इंजन संग्रह कार्यों को UNIX निर्धारित कार्यों की तरह स्वचालित रूप से चलाने की अनुमति दे सकता है, लेकिन "सशर्त ट्रिगरिंग" क्षमता की एक अतिरिक्त परत के साथ - केवल तभी निष्पादित किया जाता है जब शर्तें पूरी होती हैं, न कि एक निश्चित समय पर यांत्रिक रूप से निष्पादित की जाती हैं।
विशिष्ट संचालन
- निर्धारित संग्रह कार्यों को कॉन्फ़िगर करें:
# ~/.openclaw/tasks/scheduled_collector.yaml
अनुसूचियाँ:
- नाम: "morning_tech_news"
क्रोन: "0 8* *1-5" # सप्ताह के दिनों में सुबह 8 बजे
कार्य: daily_news_collector
शर्त: "जांचें कि क्या कल नए लेख प्रकाशित हुए थे (पिछले संग्रह रिकॉर्ड में नवीनतम लेख की तारीख की तुलना करें)"
सूचित करें: सूचित करें
on_success: "संग्रह पूरा हो गया, कुल प्राप्त नई सामग्री {गिनती}"
on_failure: "संकलन विफल: {त्रुटि}"
- वृद्धिशील संग्रह रणनीति: एजेंट कमांड में वृद्धिशील फ़िल्टरिंग तर्क जोड़ें:
चरण 1: अंतिम संग्रह रिकॉर्ड में नवीनतम लेख का प्रकाशन समय पढ़ें (~/collected_data/last_run.json में सहेजा गया)
चरण 2: केवल नए लेख एकत्र करें जिनका प्रकाशन समय इस टाइमस्टैम्प से अधिक है
चरण 3: संग्रह पूरा होने के बाद, Last_run.json में नवीनतम टाइमस्टैम्प को अपडेट करें
-
अनुसूचक प्रारंभ करें:
ओपनक्लॉ प्रारंभ #डेमन मोड में चलाएँ, स्वचालित रूप से शेड्यूलिंग कॉन्फ़िगरेशन लोड करें -
चलने की स्थिति जांचें:
ओपनक्लाव कार्य सूची # सभी कार्य स्थिति देखें openclaw कार्य लॉग मॉर्निंग_टेक_न्यूज़ # किसी विशिष्ट कार्य का निष्पादन लॉग देखें -
अधिसूचना एकीकरण: संग्रह पूरा होने के बाद अधिसूचना चैनल कॉन्फ़िगर करें - व्हाट्सएप/टेलीग्राम/स्लैक के माध्यम से संग्रह परिणाम सारांश को अपने मोबाइल फोन या टीम चैनल पर पुश करें, ताकि आप हर सुबह उठने पर कल के संग्रह का अवलोकन देख सकें।
विशेषज्ञ का दृष्टिकोण
वृद्धिशील अद्यतन "उपलब्ध" से "उपयोग में आसान" संग्रह समाधानों के लिए वाटरशेड हैं। पूर्ण संग्रह के लिए हर बार संपूर्ण लक्ष्य साइट को क्रॉल करने की आवश्यकता होती है, जिससे टोकन बर्बाद होते हैं और रिवर्स-क्रॉल होने का खतरा बढ़ जाता है। यद्यपि वृद्धिशील रणनीति तार्किक रूप से सरल है ("केवल नए प्राप्त करें"), पारंपरिक क्रॉलर में इसके कार्यान्वयन के लिए स्थिति तालिकाओं को बनाए रखने, अंतिम संग्रह स्थिति को रिकॉर्ड करने और पेजिंग ऑफसेट और अन्य विवरणों को संभालने की आवश्यकता होती है। ओपनक्लॉ एजेंट प्राकृतिक भाषा में वृद्धिशील तर्क का वर्णन कर सकता है ("अंतिम संग्रह की नवीनतम लेख तिथि की तुलना करें"), और एजेंट स्वतंत्र रूप से यह निर्धारित कर सकता है कि कौन सा नया है - यह नियतात्मक कोड पर एआई-संचालित संग्रह का एक और लाभ है: संग्रह तर्क को बदलने के लिए कोड बदलने की आवश्यकता नहीं है, केवल संकेत शब्द।
सत्यापन विधि
यह पुष्टि करने के लिए कि निर्धारित कार्य समय पर ट्रिगर होते हैं, वृद्धिशील संग्रह केवल नई सामग्री प्राप्त करता है, और सूचनाएं सामान्य रूप से वितरित की जाती हैं, यह पुष्टि करने के लिए लगातार 3 शेड्यूलिंग चक्र चलाएं (जैसे कि लगातार 3 दिन)।
चरण 7: परिणाम एकीकरण और ज्ञान आधार डॉकिंग
⏱अनुमानित समय: 2-4 घंटे 🎯लक्ष्य: वास्तविक व्यावसायिक मूल्य को अधिकतम करने के लिए साफ़ किए गए एकत्रित डेटा को डाउनस्ट्रीम सिस्टम में एकीकृत करें ⚠️पूर्व शर्ते: निर्धारित संग्रह स्थिर रूप से चलता है और डेटा गुणवत्ता मानकों के अनुरूप होती है।
ऑपरेशन निर्देश
सामग्री संग्रह अंत नहीं है, डेटा तभी मूल्यवान है जब उसका उपयोग किया जाए। यह चरण "संग्रह" से "एप्लिकेशन" तक बंद लूप को पूरा करने के लिए साफ किए गए डेटा को ज्ञान आधार, विश्लेषण डैशबोर्ड या आरएजी सिस्टम में एकीकृत करता है।
विशिष्ट संचालन
- RAG नॉलेज बेस से कनेक्ट करें: सिमेंटिक सर्च इंजन बनाने के लिए साफ किए गए JSON डेटा को वेक्टर डेटाबेस (जैसे कि लैंगचेन + क्रोमा या लामाइंडेक्स के माध्यम से) में आयात करें:
# डेटाबेस में डेटा प्रविष्टि करने के लिए OpenClaw का उपयोग करें
ओपनक्लॉ चैट"
पढ़ें ~/collect_data/cleaned_news.json,
प्रत्येक रिकॉर्ड के लिए, वेक्टर उत्पन्न करने के लिए जिना एआई के एंबेडिंग एपीआई को कॉल करें,
स्थानीय वेक्टर डेटाबेस में स्टोर करें ~/knowledge_base/,
पूरा होने के बाद, डेटाबेस में दर्ज किए गए रिकॉर्ड की कुल संख्या और विफल रिकॉर्ड की संख्या की सूचना दी जाएगी।
"
- दैनिक/साप्ताहिक रिपोर्ट तैयार करें: एकत्रित डेटा का सारांश विश्लेषण करने के लिए
Claude या
ChatGPT का उपयोग करें:
ओपनक्लॉ चैट"
पढ़ें ~/collect_data/cleaned_news.json,
मार्कडाउन प्रारूप में कल की उद्योग समाचार ब्रीफिंग तैयार करें, जिसमें शामिल हैं:
- मुख्य विषयों का वर्गीकरण और अनुपात
- प्रत्येक श्रेणी में 3 सबसे महत्वपूर्ण समाचार आइटम (सारांश सहित)
- ट्रेंडिंग कीवर्ड आँकड़े
~/रिपोर्ट/daily_briefing_{today}.md" पर सहेजें
-
डेटा डैशबोर्ड में एकीकृत करें: साफ किए गए डेटा को ओपनक्लाव के HTTP टूल के माध्यम से आंतरिक एपीआई या तृतीय-पक्ष डेटा प्लेटफ़ॉर्म (जैसे एयरटेबल, Google शीट्स, नोशन डेटाबेस) पर पोस्ट करें, ताकि एकत्रित डेटा सीधे टीम के वर्कफ़्लो में प्रवेश कर सके।
-
डेटा जीवन चक्र प्रबंधन: डेटा अवधारण नीतियां निर्धारित करें - जैसे कि 30 दिन पहले मूल डेटा का स्वचालित संपीड़न और संग्रह, और डिस्क स्थान की समाप्ति से बचने के लिए 90 दिन पहले डेटा का स्वचालित विलोपन।
विशेषज्ञ का दृष्टिकोण
अधिकांश क्रॉलर प्रोजेक्ट "डेटा प्राप्त करना" पर रुक जाते हैं और "डेटा का अच्छा उपयोग करने" का दूसरा भाग खो देते हैं। OpenClaw समाधान का लाभ यह है कि एक ही एजेंट इंजन संग्रह (ब्राउज़र नियंत्रण) और पोस्ट-प्रोसेसिंग (शेल निष्पादन/HTTP अनुरोध/फ़ाइल पढ़ने और लिखने) दोनों के लिए ज़िम्मेदार है, और विश्लेषण और सारांश के लिए एलएलएम से भी जोड़ा जा सकता है। "अधिग्रहण-प्रसंस्करण-विश्लेषण-आउटपुट" के इस पूर्ण-लिंक बंद लूप को पारंपरिक उपकरण श्रृंखला में कम से कम 3-5 स्वतंत्र घटकों (क्रॉलर फ्रेमवर्क + डेटा प्रोसेसिंग पाइपलाइन + वेक्टर लाइब्रेरी + विश्लेषण उपकरण + रिपोर्टिंग सिस्टम) की स्प्लिसिंग की आवश्यकता होती है, लेकिन ओपनक्लाव में केवल एजेंट कॉन्फ़िगरेशन फ़ाइलों का एक सेट और मध्यम मात्रा में पायथन सहायक स्क्रिप्ट की आवश्यकता होती है।
सत्यापन विधि
डेटा सफलतापूर्वक लक्ष्य प्रणाली में लिखा गया है। दैनिक/साप्ताहिक रिपोर्ट का प्रारूप सही है और सामग्री पठनीय है। पुनर्प्राप्ति परीक्षण (वेक्टर लाइब्रेरी पर आधारित) एकत्रित सामग्री का सटीक रूप से पता लगा सकता है।
अपेक्षित परिणाम
| संकेतक | पारंपरिक क्रॉलर समाधान | यह समाधान (ओपनक्लॉ) |
|---|---|---|
| नई साइट तक पहुंच का समय | 2-8 घंटे (चयनकर्ता लिखना + डिबगिंग) | 0.5-2 घंटे (प्राकृतिक भाषा विवरण लिखना) |
| वेबसाइट संशोधन का प्रभाव | चयनकर्ता अमान्य है और इसे फिर से लिखने की आवश्यकता है | शब्दार्थ निष्कर्षण, अधिकांश परिदृश्यों में समायोजन की आवश्यकता नहीं होती है |
| एकल-दिवसीय संग्रहण स्तर | स्क्रिप्ट जटिलता पर निर्भर करता है | हजार-स्तरीय पृष्ठ (व्यक्तिगत परिनियोजन) |
| रखरखाव लागत | प्रति सप्ताह लगभग 1-3 घंटे | प्रति माह लगभग 1-2 घंटे |
| रेंगने-रोधी प्रतिक्रिया | अपना स्वयं का प्रॉक्सी/आईपी पूल बनाने की आवश्यकता है | वास्तविक ब्राउज़र + दर नियंत्रण |
| डेटा सफाई एकीकरण | अलग पाइपलाइन की आवश्यकता | ओपनक्ला पूर्ण-लिंक बंद लूप |
स्वीकृति मानदंड
- [ ] कम से कम 3 लक्ष्य साइटों की संग्रह प्रक्रिया सुचारू और स्थिर चल रही है
- [ ] निर्धारित कार्य स्वचालित रूप से योजना के अनुसार निष्पादित होते हैं और बिना किसी रुकावट के 7 दिनों तक लगातार चलते हैं।
- [ ] डेटा डिडुप्लीकेशन दर ≥ 95%, फ़ील्ड अखंडता ≥ 90%
- [ ] साफ किए गए डेटा को उपयोग के लिए सीधे डाउनस्ट्रीम सिस्टम में आयात किया जा सकता है।
- [ ] संग्रह दस्तावेजों और एजेंट कॉन्फ़िगरेशन टेम्पलेट्स का पूरा बैकअप है
अक्सर पूछे जाने वाले प्रश्न और समस्या निवारण
प्र: क्या ओपनक्लॉ उन वेबसाइटों को एकत्र कर सकता है जिनके लिए लॉगिन की आवश्यकता है?
उत्तर: हाँ. ब्राउज़र में लक्ष्य वेबसाइट में मैन्युअल रूप से लॉग इन करने के बाद, लॉग इन रहने के लिए openclaw config set ब्राउज़र.cookies_path के माध्यम से कुकी फ़ाइल आयात करें। यह ध्यान दिया जाना चाहिए कि कुकीज़ की एक वैधता अवधि होती है और दीर्घकालिक संचालन को बनाए रखने के लिए नियमित रूप से ताज़ा किया जाना चाहिए।
प्रश्न: यदि संग्रह की गति बहुत धीमी है तो मुझे क्या करना चाहिए?
उ: तीन दिशाओं की जाँच करें: पहला, एलएलएम मॉडल की अनुमान गति (हाइकू या जीपीटी-4ओ-मिनी सॉनेट/ओपस से कई गुना तेज है); दूसरा, क्या DOM मोड पूर्ण के बजाय पहुंच-योग्यता पर सेट है; तीसरा, जांचें कि क्या एजेंट चरणों की संख्या बहुत अधिक है (आप एलएलएम निर्णय दौर को कम करने के लिए अधिक संक्षिप्त निर्देशों का उपयोग कर सकते हैं)। यदि यह अभी भी पर्याप्त तेज़ नहीं है, तो टेक्स्ट संग्रह के लिए ब्राउज़र रेंडरिंग के बजाय Jina AI के रीडर एपीआई का उपयोग करने पर विचार करें।
प्रश्न: यदि संग्रह प्रक्रिया के दौरान एजेंट अनंत लूप में आ जाता है तो मुझे क्या करना चाहिए?
उत्तर: एजेंट टूल के साथ यह सबसे आम समस्या है। समाधान: कॉन्फ़िगरेशन में max_steps: 25 की ऊपरी सीमा निर्धारित करें, बार-बार कार्रवाई का पता लगाने में सक्षम करें (लगातार 3 बार एक ही ऑपरेशन में कोई बदलाव नहीं होने पर स्वचालित समाप्ति), और इसे शीघ्र शब्द में स्पष्ट करें "यदि पृष्ठ पर कोई नई सामग्री लोड नहीं हुई है, तो स्क्रॉल करना बंद करें और अगले चरण पर जारी रखें।"
प्रश्न: एकत्रित डेटा की मात्रा बहुत बड़ी है, क्या ओपनक्लॉ इसे संभाल सकता है?
उ: ओपनक्लॉ का एक उदाहरण प्रतिदिन हजारों पृष्ठों के संग्रह के लिए उपयुक्त है। यदि स्तर 10,000 या अधिक तक पहुँच जाता है, तो रणनीति को विभाजित करने की अनुशंसा की जाती है: कई समानांतर ब्राउज़र सत्रों को प्रबंधित करने के लिए
प्रश्न: वेबसाइट स्वचालित ब्राउज़रों को पूरी तरह से ब्लॉक कर देती है, मुझे क्या करना चाहिए? उ: पहले पुष्टि करें कि क्या robots.txt स्पष्ट रूप से इसे प्रतिबंधित करता है। यदि यह सिर्फ एक तकनीकी एंटी-क्रॉलिंग है, तो आप ब्राउज़रबेस के क्लाउड ब्राउज़र को कॉन्फ़िगर करने का प्रयास कर सकते हैं (व्यावसायिक ब्राउज़र फ़िंगरप्रिंट प्रबंधन आमतौर पर बेहतर होता है), या जिना एआई रीडर एपीआई (ब्राउज़र रेंडरिंग लिंक को छोड़कर) के माध्यम से सर्वर से सीधे पेज प्राप्त कर सकते हैं। यदि यह अभी भी विफल रहता है, तो इसका मतलब है कि वेबसाइट की संग्रह सीमा इस योजना के दायरे से बाहर है।
योजना कार्यान्वयन चक्र और संसाधन निवेश
| स्टेज | समय | निवेश |
|---|---|---|
| पर्यावरण निर्माण और रणनीति डिजाइन | 0.5 दिन | 1 व्यक्ति (डेटा इंजीनियर/शोधकर्ता) |
| एकल साइट अनुकूलन और सत्यापन | 1-2 दिन/साइट (पहली साइट) | 1 व्यक्ति |
| मल्टी-साइट बैच एक्सेस | 0.5 दिन/साइट (बाद की साइटें) | 1 व्यक्ति |
| सफाई पाइपलाइन निर्माण | 0.5-1 दिन | 1 व्यक्ति |
| अनुसूचित तैनाती | 0.5 दिन | 1 व्यक्ति |
| ज्ञान आधार एकीकरण | 1-2 दिन | 1 व्यक्ति |
| स्थिर संचालन अवलोकन अवधि | 7 दिन | निष्क्रिय निगरानी |
लागत संरचना: सॉफ्टवेयर लागत $0 (ओपनक्ला ओपन सोर्स मुफ़्त है); एलएलएम एपीआई शुल्क कॉल की संख्या पर आधारित है, प्रति दिन हजारों पेज एकत्र करने के परिदृश्य में लगभग $5-$20/माह (क्लाउड हाइकू या जीपीटी-4ओ-मिनी का उपयोग करके); यदि ब्राउज़रबेस क्लाउड ब्राउज़र का उपयोग कर रहे हैं, तो अतिरिक्त $20-$50/माह। बुनियादी ढांचे की लागत उपयोगकर्ताओं के मौजूदा उपकरणों द्वारा वहन की जाती है।
समाधान के फायदे और नुकसान
फायदे:
- अतिरिक्त कॉन्फ़िगरेशन के बिना स्वाभाविक रूप से गतिशील पृष्ठों (एसपीए, आलसी लोडिंग, जावास्क्रिप्ट रेंडरिंग) को संभालें
- सिमेंटिक निष्कर्षण वेबसाइट संशोधनों के प्रति प्रतिरोधी है, जिससे दीर्घकालिक रखरखाव लागत काफी कम हो जाती है
- पूर्ण-लिंक बंद-लूप (अधिग्रहण→सफाई→विश्लेषण→आउटपुट), मल्टी-टूल स्प्लिसिंग की कोई आवश्यकता नहीं
- खुला स्रोत और मुफ़्त + स्व-होस्टिंग, पूर्ण डेटा संप्रभुता
नुकसान:
- एलएलएम एपीआई पर निर्भर करता है, प्रत्येक निष्कर्षण ऑपरेशन टोकन की खपत करता है (सादे पाठ पृष्ठ लागत कम करने के लिए जिना एआई रीडर का उपयोग कर सकते हैं)
- एक एकल उदाहरण बड़े पैमाने पर वितरित संग्रह के लिए उपयुक्त नहीं है (प्रति दिन 10,000 से अधिक पृष्ठों के लिए आर्किटेक्चर अपग्रेड की आवश्यकता होती है)
- एजेंट के व्यवहार में कुछ अनिश्चितता है और सीमा बाधाओं को कॉन्फ़िगर करने की आवश्यकता है (अधिकतम चरण, टाइमआउट, टोकन बजट)
- वाणिज्यिक-ग्रेड एंटी-क्रॉलिंग समाधान (अकामाई/डेटाडोम) को संभालने में असमर्थ, जिसके लिए अतिरिक्त प्रॉक्सी बुनियादी ढांचे की आवश्यकता होती है
टूल सारांश
| उपकरण | स्लग | इस परिदृश्य में भूमिका |
|---|---|---|
| ओपनक्लॉ | खुला पंजा | कोर इंजन: ब्राउज़र नियंत्रण, डेटा निष्कर्षण, कार्य ऑर्केस्ट्रेशन, शेड्यूलिंग निष्पादन |
| क्लाउड | क्लाउड | निर्देश डिजाइन सहायता, जटिल पृष्ठ समझ, डेटा विश्लेषण और रिपोर्ट निर्माण |
| चैटजीपीटी | चैटजीपीटी | वैकल्पिक एलएलएम, डेटा गुणवत्ता ऑडिट, सफाई स्क्रिप्ट सहायक पीढ़ी |
| ब्राउज़रबेस | ब्राउज़रबेस | वैकल्पिक: क्लाउड ब्राउज़र सत्र प्रबंधन, समवर्ती क्रॉलिंग, उन्नत एंटी-क्रॉलिंग प्रतिक्रिया |
| जीना ऐ | जीना-ऐ | वैकल्पिक: सादे पाठ पृष्ठों को तुरंत प्राप्त करने के लिए रीडर एपीआई, एंबेडिंग वैश्वीकरण |
उपयोगकर्ता समीक्षाएं