À propos du projet
Colly est un framework léger et performant de scraping et de crawling web écrit en Go. Il fournit une API claire et intuitive pour créer des scrapers, des crawlers et des spiders, ce qui facilite l'extraction de données structurées depuis des sites web pour des applications telles que l'exploration de données, le traitement ou l'archivage.
Les principales fonctionnalités incluent :
- API claire et élégante
- Grande vitesse (plus de 1 000 requêtes par seconde sur un seul cœur)
- Gestion automatique des délais entre requêtes et de la concurrence maximale par domaine
- Gestion automatique des cookies et des sessions
- Prise en charge du scraping synchrone, asynchrone et parallèle
- Mise en cache intégrée
- Encodage automatique des réponses non Unicode
- Prise en charge de robots.txt
- Capacités de scraping distribué
- Configuration via des variables d'environnement
- Extensible via des modules complémentaires
Le README inclut un exemple simple montrant comment créer un collector, visiter tous les liens d'une page et gérer les requêtes. Il liste également plusieurs projets open source qui utilisent Colly, comme un moteur de recherche, une base de données de jeux Steam et un cloneur de sites web. Le projet est activement maintenu et accepte les contributions.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.