عن المشروع
Crawlee هي مكتبة شاملة لجمع بيانات الويب وأتمتة المتصفح بلغة Python، صُممت لمساعدة المطورين على بناء زاحفات موثوقة بسرعة. توفر حلًا متكاملًا للزحف وجمع البيانات، من اكتشاف الروابط إلى استخراج البيانات وتخزينها.
تشمل الميزات الرئيسية:
- **واجهة موحدة** للزحف عبر HTTP والمتصفح بدون واجهة رسومية
- **زحف متوازٍ تلقائي** بناءً على موارد النظام
- **تلميحات الأنواع** لتحسين تجربة المطور وتقليل الأخطاء
- **إعادة محاولة تلقائية** عند الأخطاء أو الحظر
- **تدوير البروكسي** وإدارة الجلسات
- **توجيه طلبات قابل للتكوين** لتوجيه الروابط إلى معالجات مناسبة
- **قائمة روابط دائمة** للزحف
- **تخزين قابل للتوصيل** للبيانات الجدولية والملفات
- **معالجة أخطاء قوية**
تقدم Crawlee نوعين رئيسيين من الزاحفات:
- **BeautifulSoupCrawler**: يستخدم مكتبة HTTP وBeautifulSoup لتحليل HTML، مثالي لاستخراج البيانات بكفاءة دون تنفيذ JavaScript
- **PlaywrightCrawler**: يستخدم متصفحًا بدون واجهة عبر Playwright، مناسب للمواقع المعتمدة على JavaScript التي تتطلب تفاعلًا
تدعم مكتبات تحليل متعددة بما في ذلك Parsel وBeautifulSoup وHTTP الخام، ويمكنها تنزيل ملفات مثل HTML وPDF وJPG وPNG. تعمل المكتبة في وضعي الواجهة الرسومية وبدونها.
مقارنة بـ Scrapy، تعتمد Crawlee على asyncio، ولديها تلميحات أنواع كاملة، وتكامل أبسط (نصوص Python عادية)، وحفظ حالة أثناء الانقطاعات، وتخزين بيانات منظم (مجموعات بيانات ومخازن مفاتيح-قيم).
التثبيت مباشر عبر pip مع خيارات إضافية للميزات الإضافية. تتوفر أداة CLI لإعداد المشاريع بسرعة مع قوالب. تم تطوير Crawlee بواسطة Apify ويمكن نشرها على منصة Apify للتنفيذ السحابي.
التوثيق والأدلة والأمثلة متاحة على موقع مشروع Crawlee، مع توفر نسخة TypeScript لمشاريع JavaScript/TypeScript.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.