منصوبے کے بارے میں
Crawlee پائتھون کے لیے ایک جامع ویب اسکریپنگ اور براؤزر آٹومیشن لائبریری ہے، جو ڈویلپرز کو تیزی سے قابل اعتماد کرالر بنانے میں مدد دیتی ہے۔ یہ یو آر ایل کی دریافت سے لے کر ڈیٹا کے اخراج اور اسٹوریج تک، کرالنگ اور اسکریپنگ کے لیے ایک مکمل حل فراہم کرتی ہے۔
کلیدی خصوصیات میں شامل ہیں:
- HTTP پر مبنی اور ہیڈلیس براؤزر کرالنگ دونوں کے لیے یکساں انٹرفیس
- سسٹم کے وسائل کی بنیاد پر خودکار متوازی کرالنگ
- بہتر ڈویلپر تجربے اور کم کیڑوں کے لیے ٹائپ ہنٹس
- غلطیوں یا بلاک ہونے پر خودکار ریٹرائیز
- پراکسی گردش اور سیشن کا انتظام
- یو آر ایل کو مناسب ہینڈلرز کی طرف لے جانے کے لیے ترتیب پذیر درخواست روٹنگ
- کرالنگ کے لیے مستقل یو آر ایل قطار
- جدولی ڈیٹا اور فائلوں کے لیے قابل توسیع اسٹوریج
- مضبوط غلطی کا انتظام
Crawlee دو اہم کرالر اقسام پیش کرتی ہے:
- BeautifulSoupCrawler: یہ HTTP لائبریری اور BeautifulSoup کو HTML پارسنگ کے لیے استعمال کرتی ہے، جو جاوا اسکرپٹ کے بغیر موثر ڈیٹا نکالنے کے لیے مثالی ہے
- PlaywrightCrawler: یہ Playwright کے ذریعے ہیڈلیس براؤزر استعمال کرتی ہے، جو جاوا اسکرپٹ پر مبنی ان ویب سائٹس کے لیے موزوں ہے جنہیں انٹرایکشن کی ضرورت ہوتی ہے
یہ Parsel، BeautifulSoup، اور خام HTTP سمیت مختلف پارسنگ لائبریریوں کو سپورٹ کرتی ہے، اور HTML، PDF، JPG، PNG جیسی فائلیں ڈاؤن لوڈ کر سکتی ہے۔ یہ لائبریری ہیڈفل اور ہیڈلیس دونوں طریقوں میں کام کرتی ہے۔
Scrapy کے مقابلے میں، Crawlee asyncio پر مبنی ہے، مکمل ٹائپ ہنٹس رکھتی ہے، سادہ انضمام (باقاعدہ Python اسکرپٹ) فراہم کرتی ہے، مداخلت کے دوران حالت کی مستقل مزاجی رکھتی ہے، اور منظم ڈیٹا اسٹوریجز (ڈیٹاسیٹس اور کی-ویلیو اسٹورز) پیش کرتی ہے۔
تنصیب pip کے ذریعے آسان ہے، اضافی خصوصیات کے لیے اختیاری پیکجز موجود ہیں۔ فوری پروجیکٹ سیٹ اپ کے لیے ٹیمپلیٹس کے ساتھ ایک کلائی ٹول دستیاب ہے۔ Crawlee کو Apify نے تیار کیا ہے اور اسے کلاؤڈ پر عملدرآمد کے لیے Apify پلیٹ فارم پر تعینات کیا جا سکتا ہے۔
دستاویزات، گائیڈز اور مثالیں Crawlee پروجیکٹ کی ویب سائٹ پر دستیاب ہیں، اور جاوا اسکرپٹ/TypeScript پروجیکٹس کے لیے TypeScript نفاذ بھی موجود ہے۔
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.