À propos du projet
newspaper3k est une bibliothèque Python 3 utilisée pour scraper et curer des articles de presse. Elle permet aux utilisateurs d'extraire le contenu en texte intégral, les métadonnées et les images à partir d'URLs d'articles de presse ou en construisant un crawler pour une source d'information complète.
Les fonctionnalités clés incluent :
- Extraction d'articles : identifie et extrait automatiquement le texte principal, les auteurs, la date de publication et les images principales à partir d'une URL donnée.
- Navigation de source : la fonction `build()` peut être utilisée pour découvrir toutes les URLs d'articles et les URLs de catégories depuis une page d'accueil de journal.
- Traitement automatique du langage (NLP) : fournit des fonctionnalités intégrées pour générer des mots-clés et des résumés à partir du texte extrait.
- Support multilingue : prend en charge plus de 30 langues, dont l'anglais, le chinois, l'allemand, l'arabe et bien d'autres, avec détection automatique de la langue.
- Téléchargement multi-threadé : comprend un framework (`news_pool`) pour télécharger plusieurs articles en parallèle.
- Analyse HTML : offre une utilitaire `fulltext` pour extraire le texte du corps directement à partir de chaînes HTML.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.