Sobre el proyecto
Google Maps Scraper es una herramienta con licencia MIT para extraer datos de listados de negocios de Google Maps. Está escrita en Go y se distribuye principalmente como imagen de Docker, con versiones binarias también disponibles. El proyecto está orientado a la generación de leads, la investigación de negocios locales, la prospección de ventas y los flujos de trabajo de enriquecimiento de datos.
Interfaces
- Línea de comandos: ejecuta un scraping desde un archivo de entrada de consultas y escribe los resultados en CSV o JSON. Los flags cubren concurrencia, profundidad de desplazamiento, idioma, coordenadas geográficas, zoom, radio, cuadros delimitadores de cuadrícula, reanudación de ejecuciones interrumpidas y salida por inactividad.
- Interfaz web: una interfaz de navegador local iniciada con un solo comando de Docker, que almacena datos en una carpeta montada.
- API REST: cuando se ejecuta el servidor web, los endpoints permiten crear, listar, inspeccionar y eliminar trabajos, además de descargar resultados como CSV. La documentación OpenAPI se sirve localmente.
- Edición SaaS: una plataforma multiusuario autoalojada opcional con claves de API, interfaz de administración, cola de trabajos, workers y aprovisionamiento en la nube.
- Skill para agentes de IA: una skill instalable permite a los agentes de programación planificar búsquedas, ejecutar un scraping pequeño de validación, lanzar y monitorear el rastreo con Docker, y presentar resultados. Las credenciales de proxy se recopilan mediante un prompt local enmascarado.
Datos extraídos
Un conjunto documentado de 36 campos incluye nombre del negocio, categoría, dirección, horario de apertura, horarios populares, sitio web, teléfono, plus code, número de reseñas y valoración, desglose de valoraciones, latitud y longitud, Google CID y place ID, estado del negocio, descripciones, enlaces de reseñas, miniatura e imágenes, zona horaria, rango de precios, URL de Street View, enlaces de reserva y pedido en línea, menú, estado de reclamación por el propietario, dirección completa, tarjetas de crédito aceptadas, información "acerca de", reseñas de usuarios, reseñas extendidas (hasta aproximadamente 300 con un flag) y direcciones de correo electrónico extraídas de los sitios web de los negocios cuando la extracción de correo electrónico está habilitada. Las líneas de entrada pueden ser consultas de búsqueda simples o URL directas de Google Maps, y se pueden adjuntar IDs de entrada personalizados a las consultas.
Salida e integración
Los resultados se pueden escribir en CSV, JSON, PostgreSQL, S3, LeadsDB o plugins de escritura personalizados. Una integración integrada con LeadsDB envía leads directamente a ese servicio complementario usando una clave de API. El soporte de proxy cubre SOCKS5, HTTP y HTTPS con autenticación, proporcionados en línea o mediante un archivo de credenciales. La arquitectura se describe como escalable desde una sola máquina hasta clústeres de Kubernetes, y existe una ruta experimental para AWS Lambda. Un modo rápido en beta devuelve un conjunto reducido de resultados por consulta.
Requisitos y advertencias
La imagen de Docker usa Playwright y descarga bibliotecas de navegador en la primera ejecución. Compilar desde el código fuente requiere una cadena de herramientas de Go reciente. El README señala que los resultados de la interfaz web tardan al menos tres minutos en aparecer debido a un tiempo de ejecución mínimo configurado, que los usuarios de macOS pueden necesitar instrucciones separadas, y que una mayor concurrencia aumenta el uso de CPU y memoria y puede elevar las tasas de bloqueo o fallo, especialmente sin proxies. El repositorio está patrocinado por varios proveedores de proxies y API de scraping, y la skill para agentes puede recomendar patrocinadores de proxies, con divulgación indicada.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.