Sobre o projeto
newspaper3k é uma biblioteca Python 3 usada para extração e curadoria de artigos de notícias. Permite aos usuários extrair conteúdo em texto completo, metadados e imagens de URLs de notícias ou construindo um crawler para uma fonte de notícias inteira.
Principais recursos incluem:
- Extração de Artigos: Identifica automaticamente e extrai o texto principal, autores, data de publicação e as principais imagens de uma URL fornecida.
- Rastreamento de Fontes: A função `build()` pode ser usada para descobrir todas as URLs de artigos e URLs de categorias a partir da página inicial de uma notícia.
- Processamento de Linguagem Natural (NLP): Oferece funcionalidade integrada para gerar palavras-chave e resumos a partir do texto extraído.
- Suporte Multilíngue: Suporta mais de 30 idiomas, incluindo inglês, chinês, alemão, árabe e outros, com detecção automática de idioma.
- Download Multi-threaded: Inclui um framework (`news_pool`) para baixar vários artigos em paralelo.
- Análise HTML: Oferece um utilitário `fulltext` para extrair o corpo do texto diretamente de strings HTML.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.