À propos du projet

Crawlee est une bibliothèque complète de scraping web et d'automatisation de navigateur pour Python, conçue pour aider les développeurs à créer rapidement des crawlers fiables. Elle offre une solution de bout en bout pour le crawling et le scraping, de la découverte d'URL à l'extraction et au stockage des données. Les fonctionnalités clés incluent : - Interface unifiée pour le crawling HTTP et le crawling par navigateur sans tête - Crawling parallèle automatique basé sur les ressources système - Indications de type pour une meilleure expérience développeur et moins de bugs - Nouvelles tentatives automatiques en cas d'erreurs ou de blocage - Rotation de proxys et gestion des sessions - Routage de requêtes configurable pour diriger les URLs vers les gestionnaires appropriés - File d'attente d'URL persistante pour le crawling - Stockage enfichable pour les données tabulaires et les fichiers - Gestion robuste des erreurs Crawlee propose deux principaux types de crawlers : - BeautifulSoupCrawler : utilise la bibliothèque HTTP et BeautifulSoup pour l'analyse HTML, idéal pour une extraction efficace des données sans exécution de JavaScript - PlaywrightCrawler : utilise un navigateur sans tête via Playwright, adapté aux sites fortement basés sur JavaScript nécessitant des interactions Il prend en charge diverses bibliothèques d'analyse, notamment Parsel, BeautifulSoup et HTTP brut, et peut télécharger des fichiers tels que HTML, PDF, JPG, PNG. La bibliothèque fonctionne en modes avec et sans tête. Par rapport à Scrapy, Crawlee est basé sur asyncio, dispose d'indications de type complètes, d'une intégration plus simple (scripts Python classiques), d'une persistance d'état pendant les interruptions et de stockages de données organisés (ensembles de données et magasins clé-valeur). L'installation est simple via pip avec des extras optionnels pour des fonctionnalités supplémentaires. Un outil CLI est disponible pour une configuration rapide de projet avec des modèles. Crawlee est développé par Apify et peut être déployé sur la plateforme Apify pour une exécution dans le cloud. La documentation, les guides et les exemples sont disponibles sur le site web du projet Crawlee, avec également une implémentation TypeScript pour les projets JavaScript/TypeScript.