Sobre el proyecto
MediaCrawler es una herramienta de código abierto para la recopilación de datos de medios propios en múltiples plataformas, compatible con Xiaohongshu, Douyin, Kuaishou, Bilibili, Weibo, Tieba, Zhihu y otras plataformas principales para la captura de información pública. El proyecto se basa en el marco de automatización del navegador Playwright y obtiene datos a través de un contexto de navegador que mantiene el estado de inicio de sesión, sin necesidad de realizar ingeniería inversa de complejos algoritmos de cifrado.
Sus funciones incluyen búsqueda por palabras clave, captura por ID de publicación específico, captura de comentarios de segundo nivel, captura de la página principal de un creador específico, almacenamiento en caché del estado de inicio de sesión, grupo de proxies IP y generación de nubes de palabras a partir de comentarios. Los datos se pueden guardar en formatos CSV, JSON, JSONL, Excel, SQLite y MySQL.
Ofrece operación mediante línea de comandos y una interfaz visual WebUI, a través de la cual los usuarios pueden configurar los parámetros del rastreador, ver el estado de ejecución y los registros en tiempo real, así como previsualizar y exportar datos. Es necesario configurar la función de depuración remota del navegador Chrome y reutilizar el estado de inicio de sesión existente para reducir el riesgo de control por parte de las plataformas.
El proyecto declara explícitamente que solo se utiliza para fines de estudio e investigación y prohíbe su uso comercial o ilegal.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.