Sobre el proyecto

newspaper3k es una biblioteca de Python 3 utilizada para extraer y curar artículos de noticias. Permite a los usuarios obtener contenido completo, metadatos e imágenes desde URLs de noticias o creando un crawler para toda una fuente de noticias. Las capacidades principales incluyen: - Extracción de artículos: identifica y extrae automáticamente el texto principal, autores, fecha de publicación e imágenes destacadas desde una URL dada. - Navegación de fuentes: la función `build()` puede usarse para descubrir todas las URLs de artículos y categorías desde la página principal de un sitio de noticias. - Procesamiento del Lenguaje Natural (NLP): ofrece funcionalidad integrada para generar palabras clave y resúmenes a partir del texto extraído. - Soporte multilingüe: admite más de 30 idiomas, incluyendo inglés, chino, alemán, árabe y más, con capacidades de detección automática de idioma. - Descarga multiproceso: incluye un marco (`news_pool`) para descargar múltiples artículos en paralelo. - Análisis HTML: ofrece un utilitario `fulltext` para extraer el texto del cuerpo directamente desde cadenas HTML.