इस प्रोजेक्ट के बारे में
Colly एक हल्का और उच्च-प्रदर्शन वेब स्क्रैपिंग और क्रॉलिंग फ्रेमवर्क है जो Go में लिखा गया है। यह स्क्रैपर्स, क्रॉलर्स और स्पाइडर्स बनाने के लिए एक साफ, सहज API प्रदान करता है, जिससे डेटा माइनिंग, प्रोसेसिंग या आर्काइविंग जैसे अनुप्रयोगों के लिए वेबसाइटों से संरचित डेटा निकालना आसान हो जाता है।
मुख्य विशेषताएं शामिल हैं:
- साफ और सुंदर API
- उच्च गति (एक सिंगल कोर पर प्रति सेकंड 1k से अधिक अनुरोध)
- प्रति डोमेन अनुरोध देरी और अधिकतम समवर्तीता का स्वचालित प्रबंधन
- स्वचालित कुकी और सत्र प्रबंधन
- सिंक्रोनस, एसिंक्रोनस और समानांतर स्क्रैपिंग के लिए समर्थन
- अंतर्निहित कैशिंग
- गैर-यूनिकोड प्रतिक्रियाओं का स्वचालित एन्कोडिंग
- Robots.txt समर्थन
- वितरित स्क्रैपिंग क्षमताएं
- पर्यावरण चर के माध्यम से कॉन्फ़िगरेशन
- ऐड-ऑन के माध्यम से विस्तार योग्य
README में एक सरल उदाहरण शामिल है जो दर्शाता है कि कलेक्टर कैसे बनाएं, पृष्ठ पर सभी लिंक पर जाएं और अनुरोधों को संभालें। यह कई ओपन-सोर्स प्रोजेक्ट्स को भी सूचीबद्ध करता है जो Colly का उपयोग करते हैं, जैसे कि एक सर्च इंजन, एक स्टीम गेम डेटाबेस और एक वेबसाइट क्लोनर। यह प्रोजेक्ट सक्रिय रूप से बनाए रखा जाता है और योगदान स्वीकार करता है।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.