প্রকল্প সম্পর্কে

newspaper3k হলো একটি Python 3 লাইব্রেরি যা স্ক্র্যাপিং এবং সংবাদ নিবন্ধগুলিকে একত্রিত ও পরিচালনা করতে ব্যবহৃত হয়। এটি ব্যবহারকারীদেরকে সংবাদ URL বা একটি সম্পূর্ণ সংবাদ মাধ্যমের জন্য ক্রলার তৈরি করে পূর্ণ-টেক্সট বিষয়বস্তু, মেটাডেটা ও ছবি বের করতে দেয়। মূল ক্ষমতাগুলো হলো: - নিবন্ধ এক্সট্রাকশন: স্বয়ংক্রিয়ভাবে যেকোনো URL থেকে প্রধান টেক্সট, লেখক, প্রকাশনার তারিখ ও শীর্ষ ছবি চিহ্নিত করে বের করে নেয়। - উৎস ক্রলিং: `build()` ফাংশন ব্যবহার করে সংবাদ হোমপেজ থেকে সকল নিবন্ধ URL ও বিভাগীয় URL আবিষ্কার করা যায়। - স্বাভাবিক ভাষা প্রসেসিং (NLP): বের করা টেক্সট থেকে কিওয়ার্ড ও সারসংক্ষেপ তৈরির জন্য অন্তর্নির্মিত কার্যকারিতা সরবরাহ করে। - বহু-ভাষা সমর্থন: ইংরেজি, চীনা, জার্মান, আরবি ও অন্য অনেক সহ মোট ৩০টির বেশি ভাষা সমর্থন করে, স্বয়ংক্রিয় ভাষা শনাক্তকরণ ক্ষমতার সাথে। - মাল্টি-থ্রেডেড ডাউনলোডিং: একসাথে একাধিক নিবন্ধ ডাউনলোড করার জন্য একটি ফ্রেমওয়ার্ক (`news_pool`) অন্তর্ভুক্ত রয়েছে। - HTML প্যার্সিং: HTML স্ট্রিং থেকে সরাসরি টেক্সট বডি বের করার জন্য একটি `fulltext` ইউটিলিটি সরবরাহ করে।