Sobre o projeto
Colly é um framework leve e de alto desempenho para web scraping e crawling escrito em Go. Ele oferece uma API limpa e intuitiva para construir scrapers, crawlers e spiders, facilitando a extração de dados estruturados de sites para aplicações como mineração de dados, processamento ou arquivamento.
Principais recursos incluem:
- API limpa e elegante
- Alta velocidade (mais de 1 mil requisições por segundo em um único núcleo)
- Tratamento automático de atrasos de requisição e concorrência máxima por domínio
- Gerenciamento automático de cookies e sessões
- Suporte a scraping síncrono, assíncrono e paralelo
- Cache integrado
- Codificação automática de respostas não Unicode
- Suporte a robots.txt
- Capacidades de scraping distribuído
- Configuração via variáveis de ambiente
- Extensível por meio de add-ons
O README inclui um exemplo simples demonstrando como criar um collector, visitar todos os links de uma página e tratar requisições. Também lista vários projetos de código aberto que usam Colly, como um mecanismo de busca, um banco de dados de jogos da Steam e um clonador de sites. O projeto é mantido ativamente e aceita contribuições.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.