عن المشروع
newspaper3k هي مكتبة بايثون 3 تُستخدم في استخراج وتنظيم مقالات الأخبار. تتيح للمستخدمين استخراج المحتوى النصي الكامل، والبيانات الوصفية، والصور من عناوين URLs أو من خلال بناء برنامج زاحف لمصدر إخباري كامل.
تشمل القدرات الرئيسية:
- استخراج المقال: يحدد تلقائيًا ويستخرج النص الرئيسي، والمؤلفين، وتاريخ النشر، والصور الرئيسية من URL معين.
- تزحلق المصدر: يمكن استخدام الدالة `build()` لاكتشاف جميع عناوين URLs للمقالات وعناوين URLs للفئات من الصفحة الرئيسية للأخبار.
- معالجة اللغات الطبيعية (NLP): يوفر وظيفة مدمجة لتوليد الكلمات الرئيسية والملخصات من النص المستخرج.
- دعم متعدد اللغات: يدعم أكثر من 30 لغة، بما في ذلك الإنجليزية، والصينية، والألمانية، والعربية، والمزيد، مع قدرات اكتشاف اللغة التلقائية.
- تحميل متعدد الخيوط: يتضمن إطار عمل (`news_pool`) لتحميل عدة مقالات بالتوازي.
- تحليل HTML: يوفر أداة `fulltext` لاستخراج نص الجسم مباشرة من سلاسل HTML.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.