इस प्रोजेक्ट के बारे में

MediaCrawler एक ओपन-सोर्स मल्टी-प्लेटफॉर्म सोशल मीडिया डेटा संग्रहण टool है, जो Xiaohongshu, Douyin, Kuaishou, Bilibili, Weibo, Tieba, Zhihu आदि मुख्य प्लेटफॉर्म के सार्वजनिक जानकारी को कैप्चर करता है। यह प्रोजेक्ट Playwright ब्राउज़र टोमेशन फ्रेमवर्क पर आधारित है और लॉगिन स्टेटस को बनाए रखने वाले ब्राउज़र कॉन्टेक्स्ट एनवायरनमेंट के माध्यम से डेटा प्राप्त करता है, जिससे जटिल एन्क्रिप्शन एल्गोरिदम को रिवर्स इंजीनियर करने की आवश्यकता नहीं होती। इसकी मुख्य सुविधाओं में कीवर्ड सर्च, निर्दिष्ट पोस्ट ID से क्रॉलिंग, सेकेंड-लेवल कमेंट क्रॉलिंग, निर्दिष्ट क्रिएटर होमपेज क्रॉलिंग, लॉगिन स्टेटस कैशिंग, IP प्रॉक्सी पूल और कमेंट वर्ड क्लाउड जनरेशन शामिल हैं। डेटा को CSV, JSON, JSONL, Excel, SQLite और MySQL फॉर्मेट में सेव किया जा सकता है। इसमें कमांड-लाइन ऑपरेशन और WebUI विजुअल इंटरफेस दोनों उपलब्ध हैं। उपयोगकर्ता WebUI के माध्यम से क्रॉलर पैरामीटर कॉन्फ़िगर कर सकते हैं, रीयल-टाइम में रनिंग स्टेटस और लॉग देख सकते हैं, और डेटा प्रीव्यू तथा एक्सपोर्ट कर सकते हैं। इसका उपयोग करने के लिए Chrome ब्राउज़र की रिमोट डिबगिंग सुविधा को कॉन्फ़िगर करना आवश्यक है, ताकि मौजूदा लॉगिन स्टेटस का उपयोग करके रिस्क कंट्रोल को कम किया जा सके। प्रोजेक्ट स्पष्ट रूप से घोषणा करता है कि यह केवल शिक्षा और अनुसंधान उद्देश्यों के लिए है, और इसका व्यावसायिक या अवैध उपयोग प्रतिबंधित है।