Об этом проекте
newspaper3k — это библиотека Python 3, предназначенная для извлечения и кураторства новостных статей. Она позволяет пользователям извлекать полный текст, метаданные и изображения из новостных URL-адресов или строить краулер для всего новостного источника.
Ключевые возможности включают:
- Извлечение статей: автоматически определяет и извлекает основной текст, авторов, дату публикации и ключевые изображения по заданному URL.
- Краулинг источников: функция `build()` может использоваться для обнаружения всех URL-адресов статей и категорий с главной страницы новостного сайта.
- Обработка естественного языка (NLP): предоставляет встроенные функции для генерации ключевых слов и резюме из извлечённого текста.
- Поддержка нескольких языков: поддерживает более 30 языков, включая английский, китайский, немецкий, арабский и другие, с автоматическим определением языка.
- Многопоточная загрузка: включает инфраструктуру (`news_pool`) для параллельной загрузки множества статей.
- Разбор HTML: предлагает утилиту `fulltext` для извлечения основного текста непосредственно из HTML-строк.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.