इस प्रोजेक्ट के बारे में

Crawlee, Python के लिए एक व्यापक वेब स्क्रैपिंग और ब्राउज़र स्वचालन लाइब्रेरी है, जिसे डेवलपर्स को जल्दी से विश्वसनीय क्रॉलर बनाने में मदद करने के लिए डिज़ाइन किया गया है। यह URL खोज से लेकर डेटा निष्कर्षण और भंडारण तक, क्रॉलिंग और स्क्रैपिंग के लिए एक एंड-टू-एंड समाधान प्रदान करता है। मुख्य विशेषताओं में शामिल हैं: - HTTP-आधारित और हेडलेस ब्राउज़र क्रॉलिंग दोनों के लिए एकीकृत इंटरफ़ेस - सिस्टम संसाधनों के आधार पर स्वचालित समानांतर क्रॉलिंग - बेहतर डेवलपर अनुभव और कम बग के लिए टाइप हिंट - त्रुटियों या ब्लॉकिंग पर स्वचालित रीट्राई - प्रॉक्सी रोटेशन और सत्र प्रबंधन - URL को उपयुक्त हैंडलर तक पहुँचाने के लिए कॉन्फ़िगर करने योग्य अनुरोध रूटिंग - क्रॉलिंग के लिए स्थायी URL कतार - सारणीबद्ध डेटा और फ़ाइलों के लिए प्लग करने योग्य स्टोरेज - मजबूत त्रुटि हैंडलिंग Crawlee दो मुख्य क्रॉलर प्रकार प्रदान करता है: - BeautifulSoupCrawler: HTML पार्सिंग के लिए HTTP लाइब्रेरी और BeautifulSoup का उपयोग करता है, जो JavaScript निष्पादन के बिना कुशल डेटा निष्कर्षण के लिए आदर्श है। - PlaywrightCrawler: Playwright के माध्यम से हेडलेस ब्राउज़र का उपयोग करता है, जो इंटरैक्शन की आवश्यकता वाली JavaScript-भारी साइटों के लिए उपयुक्त है। यह Parsel, BeautifulSoup और रॉ HTTP सहित विभिन्न पार्सिंग लाइब्रेरी का समर्थन करता है, और HTML, PDF, JPG, PNG जैसी फ़ाइलें डाउनलोड कर सकता है। लाइब्रेरी हेडफुल और हेडलेस दोनों मोड में काम करती है। Scrapy की तुलना में, Crawlee asyncio-आधारित है, इसमें पूर्ण टाइप हिंट हैं, सरल एकीकरण (नियमित Python स्क्रिप्ट), रुकावटों के दौरान स्थिति की दृढ़ता, और संगठित डेटा स्टोर (डेटासेट और की-वैल्यू स्टोर) हैं। स्थापना विशेष अतिरिक्त सुविधाओं के लिए वैकल्पिक एक्स्ट्रा के साथ pip के माध्यम से सीधी है। टेम्पलेट्स के साथ त्वरित प्रोजेक्ट सेटअप के लिए एक CLI टूल उपलब्ध है। Crawlee को Apify द्वारा विकसित किया गया है और इसे क्लाउड निष्पादन के लिए Apify प्लेटफ़ॉर्म पर तैनात किया जा सकता है। दस्तावेज़ीकरण, गाइड और उदाहरण Crawlee प्रोजेक्ट वेबसाइट पर उपलब्ध हैं, और JavaScript/TypeScript प्रोजेक्ट्स के लिए TypeScript कार्यान्वयन भी उपलब्ध है।