À propos du projet

newspaper3k est une bibliothèque Python 3 utilisée pour scraper et curer des articles de presse. Elle permet aux utilisateurs d'extraire le contenu en texte intégral, les métadonnées et les images à partir d'URLs d'articles de presse ou en construisant un crawler pour une source d'information complète. Les fonctionnalités clés incluent : - Extraction d'articles : identifie et extrait automatiquement le texte principal, les auteurs, la date de publication et les images principales à partir d'une URL donnée. - Navigation de source : la fonction `build()` peut être utilisée pour découvrir toutes les URLs d'articles et les URLs de catégories depuis une page d'accueil de journal. - Traitement automatique du langage (NLP) : fournit des fonctionnalités intégrées pour générer des mots-clés et des résumés à partir du texte extrait. - Support multilingue : prend en charge plus de 30 langues, dont l'anglais, le chinois, l'allemand, l'arabe et bien d'autres, avec détection automatique de la langue. - Téléchargement multi-threadé : comprend un framework (`news_pool`) pour télécharger plusieurs articles en parallèle. - Analyse HTML : offre une utilitaire `fulltext` pour extraire le texte du corps directement à partir de chaînes HTML.