Sobre el proyecto
Este proyecto proporciona un pipeline de datos de clickstream completamente serverless construido sobre servicios de AWS. Acepta eventos de click en tiempo real a través de Amazon API Gateway, los enruta hacia Kinesis Data Streams para ingestión, transforma y particiona los datos en formato Parquet mediante Kinesis Firehose, y almacena todo en S3 como un lago de datos. AWS Glue cataloga el esquema mientras que Athena permite consultas SQL ad-hoc. Un Lambda programado por EventBridge realiza la reparación automática de particiones.
El repositorio incluye Infraestructura como Código usando AWS SAM y CloudFormation para despliegues repetibles y controlados por versión. Los payloads entrantes usan formato JSONL codificado en Base64, con deviceId como clave de partición de Kinesis. Los datos transformados se almacenan con particionamiento por año/mes/día y compresión Snappy para consultas rentables.
Las consideraciones de producción están documentadas extensamente, cubriendo optimización de tasa de ingestión, compresión del lado del cliente, manejo de evolución de esquemas, monitoreo con CloudWatch, patrones de seguridad y alternativas a la reparación por lotes de particiones para escenarios en tiempo real. Los datos originales provienen de un conjunto de datos de clickstream de Kaggle.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.