newspaper3k एक पायथन 3 लाइब्रेरी है जो वेब से समाचार लेख निकालने और संपादित करने के लिए डिज़ाइन की गई है, जिसमें पूर्ण-पाठ और मेटाडेटा निष्कर्षण के लिए उपकरण उपलब्ध हैं।
ओपन सोर्स। नई संभावनाएँ।
उत्कृष्ट ओपन-सोर्स प्रोजेक्ट खोजें, गुमनाम रूप से प्रोजेक्ट सबमिट करें और अपने प्रोजेक्ट का दावा कर उसे संपादित करें।
जिज्ञासा के साथ ओपन सोर्स खोजें।
THE FIRST COLLECTIONईज़ीस्पाइडर (EasySpider) एक पूरी तरह से मुफ्त विज़ुअल नो-कोड वेब क्रॉलर और ब्राउज़र ऑटोमेशन टूल है। यह ग्राफ़िकल इंटरफ़ेस के माध्यम से वेब तत्वों का चयन करके डेटा संग्रह कार्यों को डिज़ाइन करने की अनुमति देता है, और कमांड-लाइन निष्पादन, फ़्लोचार्ट लॉजिक, शेड्यूल्ड कार्यों और द्वितीयक विकास का समर्थन करता है।
Douyin और TikTok के लिए एक स्व-होस्टेड डेटा API। यह पोस्ट, प्रोफ़ाइल, कमेंट्स और प्लेलिस्ट प्राप्त करता है, और वीडियो व इमेज एल्बम बिना वॉटरमार्क के डाउनलोड करता है। इसमें सेल्फ-हीलिंग आइडेंटिटी पूल, PostgreSQL आर्काइविंग, REST API, MCP सर्वर, CLI और वेब कंसोल शामिल हैं।
Lux एक तेज़ वीडियो डाउनलोडर CLI टूल है जो Go में बनाया गया है। यह YouTube, Bilibili, Instagram आदि से वीडियो, प्लेलिस्ट, छवि एवं ऑडियो डाउनलोड करता है।
Huginn एक सेल्फ-होस्टेड सिस्टम है जिसका उपयोग ऐसे एजेंट बनाने के लिए किया जाता है जो इवेंट्स की निगरानी करके और आपकी ओर से कार्रवाई करके ऑनलाइन कार्यों को स्वचालित करते हैं।
Firecrawl एक ओपन-सोर्स वेब डेटा API है जो वेबसाइटों को खोजने, स्क्रैप करने, क्रॉल करने और उनसे इंटरैक्ट करने के लिए है, पेजों को साफ Markdown, JSON या स्क्रीनशॉट में बदलकर AI एजेंट्स और ऐप्स के लिए LLM-ready उपयोग योग्य बनाता है।
Crawlee एक Python वेब स्क्रैपिंग और ब्राउज़र स्वचालन लाइब्रेरी है जो विश्वसनीय क्रॉलर बनाने के लिए है। यह HTTP और हेडलेस ब्राउज़र क्रॉलिंग, स्वचालित रीट्राई, प्रॉक्सी रोटेशन और AI/LLM अनुप्रयोगों के लिए डेटा स्टोरेज का समर्थन करता है।
requests पर आधारित एक Bilibili वीडियो बैच डाउनलोडर, जो मल्टी-पार्ट डाउनलोड, सबटाइटल, बैलेट और कवर कैप्चर का समर्थन करता है, साथ ही ग्राफिकल इंटरफेस और AI कॉर्पस ट्रांसक्रिप्शन सुविधा प्रदान करता है।