عن المشروع

MediaCrawler هو أداة مفتوحة المصدر لجمع بيانات وسائل التواصل الذاتية من منصات متعددة، تدعم Xiaohongshu وDouyin وKuaishou وBilibili وWeibo وTieba وZhihu وغيرها من المنصات الرئيسية لجلب المعلومات العامة. يعتمد المشروع على إطار الأتمتة المتصفح Playwright، حيث يحصل على البيانات من خلال سياق المتصفح الذي يحافظ على حالة تسجيل الدخول، دون الحاجة إلى عكس خوارزميات التشفير المعقدة. تشمل الوظائف البحث بالكلمات المفتاحية، وجمع المنشورات حسب معرف المنشور المحدد، وجمع التعليقات الثانوية، وجلب الصفحة الرئيسية للمبدع المحدد، وتخزين حالة تسجيل الدخول مؤقتًا، ومجموعة وكلاء IP، وتوليد سحابة كلمات للتعليقات. تدعم البيانات الحفظ بصيغ CSV وJSON وJSONL وExcel وSQLite وMySQL. يوفر الأداة واجهة سطر الأوامر وواجهة WebUI المرئية، حيث يمكن للمستخدمين من خلال WebUI تكوين معلمات الزاحف، ومشاهدة حالة التشغيل والسجلات في الوقت الفعلي، ومعاينة البيانات وتصديرها. يتطلب الاستخدام تكوين وظيفة تصحيح Chrome البعيد، وإعادة استخدام حالة تسجيل الدخول الحالية لتقليل مخاطر الرقابة. يصرح المشروع صراحةً أنه يُستخدم للأغراض التعليمية والبحثية فقط، ويُحظر استخدامه للأغراض التجارية أو غير القانونية.