프로젝트 소개

Colly은 Go로 작성된 경량의 고성능 웹 스크래핑 및 크롤링 프레임워크입니다. 스크래퍼, 크롤러, 스파이더를 구축하기 위한 깔끔하고 직관적인 API를 제공하여 데이터 마이닝, 처리 또는 아카이빙과 같은 애플리케이션을 위해 웹사이트에서 구조화된 데이터를 쉽게 추출할 수 있습니다. 주요 기능은 다음과 같습니다: - 깔끔하고 우아한 API - 높은 속도(단일 코어에서 초당 1k 이상의 요청) - 요청 지연 및 도메인별 최대 동시성 자동 처리 - 자동 쿠키 및 세션 관리 - 동기, 비동기 및 병렬 스크래핑 지원 - 내장 캐싱 - 비유니코드 응답의 자동 인코딩 - Robots.txt 지원 - 분산 스크래핑 기능 - 환경 변수를 통한 구성 - 애드온을 통한 확장 가능 README에는 수집기를 생성하고, 페이지의 모든 링크를 방문하며, 요청을 처리하는 방법을 보여주는 간단한 예제가 포함되어 있습니다. 또한 검색 엔진, Steam 게임 데이터베이스, 웹사이트 클로너 등 Colly을 사용하는 여러 오픈소스 프로젝트가 나열되어 있습니다. 이 프로젝트는 활발히 유지 관리되며 기여를 받고 있습니다.