Об этом проекте

newspaper3k — это библиотека Python 3, предназначенная для извлечения и кураторства новостных статей. Она позволяет пользователям извлекать полный текст, метаданные и изображения из новостных URL-адресов или строить краулер для всего новостного источника. Ключевые возможности включают: - Извлечение статей: автоматически определяет и извлекает основной текст, авторов, дату публикации и ключевые изображения по заданному URL. - Краулинг источников: функция `build()` может использоваться для обнаружения всех URL-адресов статей и категорий с главной страницы новостного сайта. - Обработка естественного языка (NLP): предоставляет встроенные функции для генерации ключевых слов и резюме из извлечённого текста. - Поддержка нескольких языков: поддерживает более 30 языков, включая английский, китайский, немецкий, арабский и другие, с автоматическим определением языка. - Многопоточная загрузка: включает инфраструктуру (`news_pool`) для параллельной загрузки множества статей. - Разбор HTML: предлагает утилиту `fulltext` для извлечения основного текста непосредственно из HTML-строк.