newspaper3k est une bibliothèque Python 3 conçue pour extraire et compiler des articles du web, offrant des outils d'extraction de texte complet et de métadonnées.
Code ouvert. Horizons nouveaux.
Découvrez des projets open source de qualité, soumettez des projets anonymement, puis revendiquez et éditez votre propre projet.
Un peu de curiosité. Un monde de code ouvert.
THE FIRST COLLECTIONScrapy est un framework de web scraping rapide et haut niveau pour Python, permettant d'extraire des données structurées. Multiplateforme, il nécessite Python 3.10+ et est maintenu par Zyte.
Framework de scraping web adaptatif pour Python : suivi intelligent du DOM, fetchers contournant les anti-bots, crawling concurrent avec pause/reprise, rotation de proxys et sortie prête pour MCP/IA.
Crawlee est une bibliothèque Python de scraping web et d'automatisation de navigateur pour créer des crawlers fiables. Elle prend en charge le crawling HTTP et par navigateur sans tête, les nouvelles tentatives automatiques, la rotation de proxys et le stockage de données pour les applications IA/LLM.