Об этом проекте
Colly — это легкий и высокопроизводительный фреймворк для веб-скрапинга и обхода сайтов, написанный на Go. Он предоставляет чистый и интуитивно понятный API для создания скраперов, краулеров и пауков, что упрощает извлечение структурированных данных с веб-сайтов для таких задач, как интеллектуальный анализ данных, их обработка или архивирование.
Ключевые возможности:
- Чистый и элегантный API
- Высокая скорость (более 1 тыс. запросов в секунду на одном ядре)
- Автоматическая обработка задержек запросов и максимального параллелизма для каждого домена
- Автоматическое управление cookie и сессиями
- Поддержка синхронного, асинхронного и параллельного скрапинга
- Встроенное кэширование
- Автоматическое кодирование ответов в не-Unicode
- Поддержка robots.txt
- Возможности распределенного скрапинга
- Настройка через переменные окружения
- Расширяемость с помощью дополнений
В README приведен простой пример, демонстрирующий создание коллектора, обход всех ссылок на странице и обработку запросов. Также перечислены несколько проектов с открытым исходным кодом, использующих Colly, например поисковая система, база данных игр Steam и клонер веб-сайтов. Проект активно поддерживается и принимает вклад сообщества.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.