Scrapy est un framework de web scraping rapide et haut niveau pour Python, permettant d'extraire des données structurées. Multiplateforme, il nécessite Python 3.10+ et est maintenu par Zyte.
Code ouvert. Horizons nouveaux.
Découvrez des projets open source de qualité, soumettez des projets anonymement, puis revendiquez et éditez votre propre projet.
Un peu de curiosité. Un monde de code ouvert.
THE FIRST COLLECTIONFramework de scraping web adaptatif pour Python : suivi intelligent du DOM, fetchers contournant les anti-bots, crawling concurrent avec pause/reprise, rotation de proxys et sortie prête pour MCP/IA.
Firecrawl est une API open source de données web permettant de rechercher, scraper, crawler et interagir avec des sites, en convertissant les pages en Markdown, JSON ou captures d'écran propres, prêtes pour les LLM et les agents IA.
Crawlee est une bibliothèque Python de scraping web et d'automatisation de navigateur pour créer des crawlers fiables. Elle prend en charge le crawling HTTP et par navigateur sans tête, les nouvelles tentatives automatiques, la rotation de proxys et le stockage de données pour les applications IA/LLM.
Maigret est un outil OSINT en ligne de commande qui construit un dossier sur une personne à partir d'un seul nom d'utilisateur, vérifiant plus de 3000 sites, extrayant des données de profil et exportant des rapports en HTML, PDF, JSON, CSV et formats graphiques.