Sobre o projeto

MediaCrawler é uma ferramenta de código aberto para coleta de dados de mídias sociais em múltiplas plataformas, que suporta a captura de informações públicas de Xiaohongshu, Douyin, Kuaishou, Bilibili, Weibo, Tieba, Zhihu e outras plataformas principais. O projeto é baseado no framework de automação de navegador Playwright, obtendo dados por meio de um contexto de navegador que preserva o estado de login, sem necessidade de engenharia reversa de algoritmos de criptografia complexos. As funcionalidades incluem pesquisa por palavra-chave, coleta por ID de post específico, coleta de comentários de segundo nível, coleta de página inicial de criador específico, cache de estado de login, pool de proxies IP e geração de nuvem de palavras de comentários. Os dados podem ser salvos nos formatos CSV, JSON, JSONL, Excel, SQLite e MySQL. A ferramenta oferece operação via linha de comando e interface visual WebUI, permitindo que o usuário configure parâmetros do crawler, visualize logs e status de execução em tempo real, e realize pré-visualização e exportação de dados. É necessário configurar o recurso de depuração remota do navegador Chrome para reutilizar o estado de login existente e reduzir riscos de bloqueio. O projeto declara explicitamente que é destinado apenas a fins de estudo e pesquisa, sendo proibido o uso comercial ou ilegal.