عن المشروع

newspaper3k هي مكتبة بايثون 3 تُستخدم في استخراج وتنظيم مقالات الأخبار. تتيح للمستخدمين استخراج المحتوى النصي الكامل، والبيانات الوصفية، والصور من عناوين URLs أو من خلال بناء برنامج زاحف لمصدر إخباري كامل. تشمل القدرات الرئيسية: - استخراج المقال: يحدد تلقائيًا ويستخرج النص الرئيسي، والمؤلفين، وتاريخ النشر، والصور الرئيسية من URL معين. - تزحلق المصدر: يمكن استخدام الدالة `build()` لاكتشاف جميع عناوين URLs للمقالات وعناوين URLs للفئات من الصفحة الرئيسية للأخبار. - معالجة اللغات الطبيعية (NLP): يوفر وظيفة مدمجة لتوليد الكلمات الرئيسية والملخصات من النص المستخرج. - دعم متعدد اللغات: يدعم أكثر من 30 لغة، بما في ذلك الإنجليزية، والصينية، والألمانية، والعربية، والمزيد، مع قدرات اكتشاف اللغة التلقائية. - تحميل متعدد الخيوط: يتضمن إطار عمل (`news_pool`) لتحميل عدة مقالات بالتوازي. - تحليل HTML: يوفر أداة `fulltext` لاستخراج نص الجسم مباشرة من سلاسل HTML.