इस प्रोजेक्ट के बारे में

newspaper3k समाचार लेखों को खींचने और संरचित करने के लिए उपयोग की जाने वाली एक पायथन 3 लाइब्रेरी है। यह उपयोगकर्ताओं को समाचार URLs या पूरी समाचार स्रोत के लिए क्रॉलर बनाकर पूर्ण-पाठ सामग्री, मेटाडेटा और छवियों को निकालने की अनुमति देता है। मुख्य क्षमताएँ: - लेख निष्कर्षण: किसी दिए गए URL से मुख्य पाठ, लेखकों, प्रकाशन तिथि और शीर्ष छविओं की स्वचालित रूप से पहचान करके उनमें से निकालता है। - स्रोत क्रॉलिंग: `build()` फ़ंक्शन का उपयोग समाचार होमपेज से सभी लेख URLs और श्रेणी URLs खोजने के लिए किया जा सकता है। - प्राकृतिक भाषा प्रसंस्करण (NLP): निकाले गए पाठ से कीवर्ड और सारांश उत्पन्न करने के लिए अंतर्निहित कार्यक्षमता प्रदान करता है। - बहु-भाषा समर्थन: अंग्रेजी, चीनी, जर्मन, अरबी और अन्य सहित 30 से अधिक भाषाओं का समर्थन करता है, स्वचालित भाषा पहचान क्षमताओं के साथ। - मल्टी-थ्रेडेड डाउनलोडिंग: कई लेखों को समानांतर में डाउनलोड करने के लिए एक ढांचा (`news_pool`) शामिल है। - HTML पार्सिंग: HTML स्ट्रिंग्स से सीधे बॉडी टेक्सट निकालने के लिए एक `fulltext` उपयोगिता प्रदान करता है।