Sobre el proyecto
newspaper3k es una biblioteca de Python 3 utilizada para extraer y curar artículos de noticias. Permite a los usuarios obtener contenido completo, metadatos e imágenes desde URLs de noticias o creando un crawler para toda una fuente de noticias.
Las capacidades principales incluyen:
- Extracción de artículos: identifica y extrae automáticamente el texto principal, autores, fecha de publicación e imágenes destacadas desde una URL dada.
- Navegación de fuentes: la función `build()` puede usarse para descubrir todas las URLs de artículos y categorías desde la página principal de un sitio de noticias.
- Procesamiento del Lenguaje Natural (NLP): ofrece funcionalidad integrada para generar palabras clave y resúmenes a partir del texto extraído.
- Soporte multilingüe: admite más de 30 idiomas, incluyendo inglés, chino, alemán, árabe y más, con capacidades de detección automática de idioma.
- Descarga multiproceso: incluye un marco (`news_pool`) para descargar múltiples artículos en paralelo.
- Análisis HTML: ofrece un utilitario `fulltext` para extraer el texto del cuerpo directamente desde cadenas HTML.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.