프로젝트 소개
MediaCrawler는 오픈소스 멀티플랫폼 자체 미디어 데이터 수집 도구로, 샤오홍슈(小红书), 더우인(抖音), 콰이솔(快手), Bilibili, 웨이보(微博), 티에바(贴吧), 지후(知乎) 등 주요 플랫폼의 공개 정보 수집을 지원한다. 프로젝트는 Playwright 브라우저 자동화 프레임워크를 기반으로 하며, 로그인 상태를 유지한 브라우저 컨텍스트 환경을 통해 데이터를 획득하므로 복잡한 암호화 알고리즘 역공학이 필요 없다.
기능으로는 키워드 검색, 지정 게시물 ID 크롤링, 2차 댓글 크롤링, 지정 크리에이터 홈페이지 크롤링, 로그인 상태 캐싱, IP 프록시 풀 및 댓글 워드클라우드 생성이 포함된다. 데이터는 CSV, JSON, JSONL, Excel, SQLite, MySQL 형식으로 저장할 수 있다.
명령줄 조작과 WebUI 시각화 인터페이스를 제공하며, 사용자는 WebUI를 통해 크롤러 매개변수를 설정하고, 실시간 실행 상태와 로그를 확인하며, 데이터를 미리 보고 내보낼 수 있다. 사용 시 Chrome 브라우저의 원격 디버깅 기능을 설정하여 기존 로그인 상태를 재사용함으로써 리스크 제어 위험을 줄여야 한다.
프로젝트는 학습 및 연구 목적으로만 사용하며, 상업적 또는 불법적 용도는 금지한다고 명확히 밝히고 있다.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.