Об этом проекте

Colly — это легкий и высокопроизводительный фреймворк для веб-скрапинга и обхода сайтов, написанный на Go. Он предоставляет чистый и интуитивно понятный API для создания скраперов, краулеров и пауков, что упрощает извлечение структурированных данных с веб-сайтов для таких задач, как интеллектуальный анализ данных, их обработка или архивирование. Ключевые возможности: - Чистый и элегантный API - Высокая скорость (более 1 тыс. запросов в секунду на одном ядре) - Автоматическая обработка задержек запросов и максимального параллелизма для каждого домена - Автоматическое управление cookie и сессиями - Поддержка синхронного, асинхронного и параллельного скрапинга - Встроенное кэширование - Автоматическое кодирование ответов в не-Unicode - Поддержка robots.txt - Возможности распределенного скрапинга - Настройка через переменные окружения - Расширяемость с помощью дополнений В README приведен простой пример, демонстрирующий создание коллектора, обход всех ссылок на странице и обработку запросов. Также перечислены несколько проектов с открытым исходным кодом, использующих Colly, например поисковая система, база данных игр Steam и клонер веб-сайтов. Проект активно поддерживается и принимает вклад сообщества.