Sobre el proyecto

La guía de Clickstream Analytics on AWS es una implementación de referencia exhaustiva que le permite construir una plataforma de datos de clickstream de stack completo en AWS. La solución recopila datos de eventos de clientes web, Android, iOS, Flutter, React-Native y otros a través de SDKs diseñados específicamente, transporta los datos mediante una capa de ingesta configurable, los procesa con Spark en EMR Serverless, los almacena en Amazon S3, Redshift y DynamoDB, y visualiza métricas clave con Amazon QuickSight. Componentes clave: - UI de front-end alojada en S3 y servida a través de CloudFront. - APIs de backend creadas con API Gateway, Lambda y protegidas por Cognito u OIDC. - Orquestación del ciclo de vida del pipeline utilizando Step Functions, EventBridge y CloudFormation. - Pipeline de datos compuesto por ALB, ECS, Amazon MSK o Kinesis Data Streams, S3, EMR Serverless, Redshift y QuickSight. - SDKs para múltiples plataformas (Android, iOS/Swift, Flutter, React-Native, Web) que capturan automáticamente eventos comunes y permiten el reporte de eventos personalizados. - Dashboards de QuickSight pre-ensamblados que cubren adquisición, compromiso, actividad, retención, dispositivo e información geográfica. Los prerrequisitos incluyen un SO moderno (macOS, Linux, Windows), AWS CLI, Python 3.11+, Node 20+, pnpm, Docker y una cuenta de AWS con AdministratorAccess. El CDK debe ser bootstrapped antes del despliegue. Pasos de despliegue: 1. Clonar el repositorio. 2. Instalar pnpm y las dependencias del proyecto. 3. Hacer el bootstrap del entorno CDK. 4. Ejecutar el script de despliegue proporcionado (solution-deploy.sh) con los parámetros de región, perfil y correo electrónico. 5. Después de que CloudFormation reporte CREATE_COMPLETE, abra la URL de CloudFront para acceder a la consola. Después del despliegue, puede crear pipelines de datos, registrar aplicaciones, integrar los SDKs y comenzar a ver las analíticas. La guía también cubre la personalización (eventos personalizados, plugins de transformación de datos), la integración con otros servicios de AWS (Personalize, SageMaker), estrategias de escalado y gobernanza de datos (retención, controles GDPR/CCPA). Las instrucciones de limpieza aconsejan eliminar los pipelines y las aplicaciones a través de la consola antes de eliminar los stacks de CloudFormation y los buckets de S3 opcionales. Para los desarrolladores, el repositorio incluye scripts para ejecutar el plano de control localmente, compilar el JAR de Spark ETL y ejecutar pruebas unitarias con pnpm. Se proporcionan FAQ detallados, problemas conocidos y enlaces de resolución de problemas. En general, esta guía ofrece una solución de analítica de clickstream de extremo a extremo y grado de producción que puede adaptarse a una amplia gama de necesidades empresariales aprovechando los servicios totalmente gestionados de AWS.