newspaper3k ویب سے مضامین اخذ اور مرتب کرنے کے لیے ڈیزائن کردہ پایتھن 3 لائبریری ہے جو مکمل متن اور میٹا ڈیٹا اخذ کے لیے آلات فراہم کرتی ہے۔
اوپن سورس۔ نئے امکانات۔
معیاری اوپن سورس پروجیکٹس دریافت کریں، گمنام طور پر پروجیکٹس جمع کریں، اور اپنے پروجیکٹ کا دعویٰ کرکے اسے ایڈٹ کریں۔
تجسس کے ساتھ اوپن سورس کی دنیا دریافت کریں۔
THE FIRST COLLECTION易采集(EasySpider)ایک مکمل طور پر مفت بصری کوڈنگ کے بغیر ویب کرائیلر اور براؤزر آٹومیشن ٹول ہے جو گرافیکل انٹرفیس کے ذریعے کام ڈیزائن کرنے کی سہولت دیتا ہے۔
ڈوین اور ٹک ٹاک کے لیے ایک خود میزبان ڈیٹا API جو پوسٹس، پروفائلز، کمنٹس اور پلے لسٹس حاصل کرتا ہے۔ یہ بغیر واٹر مارک والی ویڈیوز اور تصاویر ڈاؤن لوڈ کر سکتا ہے۔ اس میں خود بخود ٹھیک ہونے والا آئیڈینٹیٹی پول، PostgreSQL ذخیرہ کاری، REST API، MCP سرور، CLI اور ویب کنسول شامل ہیں۔
اسکرپی پائیتھن کے لیے ایک تیز اور ہائی لیول ویب اسکرپنگ فریم ورک ہے جو ویب سائٹس سے ساختی ڈیٹا نکالنے کے لیے استعمال ہوتا ہے۔ یہ کراس پلیٹ فارم ہے اور پائیتھن 3.10 یا اس سے نیا ورژن درکار ہے۔
لکس گو سے لکھا گیا ایک تیز اور سادہ ویڈیو ڈاؤن لوڈر CLI ٹول ہے جو یوٹیوب، بلبیلی، انسٹاگرام سمیت مختلف ویب سائٹس سے ویڈیوز، پلی لسٹس، تصاویر اور آڈیو ڈاؤن لوڈ کرنے کی سہولت دیتا ہے۔
پائتھون کے لیے موافق ویب اسکریپنگ فریم ورک: ذہین DOM ٹریکنگ، اینٹی بوٹ بائی پاس فیچرز، توقف/بحالی کے ساتھ متوازی کرالنگ، پراکسی روٹیشن، اور MCP/AI کے لیے تیار آؤٹ پٹ۔
Firecrawl ایک اوپن سورس ویب ڈیٹا API ہے جو ویب سائٹس کو تلاش، اسکریپ، کرال اور انٹرایکٹ کرنے کے لیے استعمال ہوتی ہے، اور صفحات کو LLM کے لیے تیار صاف Markdown، JSON یا اسکرین شاٹس میں تبدیل کرتی ہے۔
AH Crawler ویب سائٹ سرچ اور تجزیے کے لیے ایک اوپن سورس ٹول ہے جو PHP ماحول میں چلتا ہے۔
Crawlee ایک Python ویب اسکریپنگ اور براؤزر آٹومیشن لائبریری ہے جو قابل اعتماد کرالر بنانے کے لیے استعمال ہوتی ہے۔ یہ HTTP اور ہیڈلیس براؤزر کرالنگ، خودکار ریٹرائیز، پراکسی گردش، اور AI/LLM ایپلیکیشنز کے لیے ڈیٹا اسٹوریج کو سپورٹ کرتی ہے۔