Об этом проекте
MediaCrawler — это открытый инструмент для сбора данных из социальных сетей, поддерживающий Xiaohongshu, Douyin, Kuaishou, Bilibili, Weibo, Tieba, Zhihu и другие платформы. Проект построен на базе фреймворка автоматизации браузера Playwright и получает данные через контекст браузера с сохранённым состоянием входа, что позволяет избежать необходимости реверс-инжиниринга сложных алгоритмов шифрования.
Основные функции включают поиск по ключевым словам, сбор данных по указанному ID поста, сбор вложенных комментариев, парсинг профилей авторов, кэширование состояния входа, пул IP-прокси и генерацию облака слов на основе комментариев. Собранные данные можно сохранять в форматах CSV, JSON, JSONL, Excel, SQLite и MySQL.
Инструмент поддерживает работу через командную строку и веб-интерфейс WebUI. В WebUI пользователи могут настраивать параметры краулера, просматривать статус выполнения и журналы в реальном времени, а также выполнять предварительный просмотр и экспорт данных. Для использования требуется настроить удалённую отладку в браузере Chrome, чтобы повторно использовать существующее состояние входа и снизить риски срабатывания антифрод-механизмов.
Проект явно заявляет, что предназначен только для учебных и исследовательских целей и запрещает коммерческое или незаконное использование.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.