Sobre o projeto
Este projeto oferece um pipeline de dados clickstream serverless completo construído com serviços AWS. Ele aceita eventos click em tempo real por meio do Amazon API Gateway, roteia-os para o Kinesis Data Streams para ingestão, transforma e particiona os dados em formato Parquet via Kinesis Firehose e armazena tudo no S3 como data lake. O AWS Glue cataloga o esquema enquanto o Athena permite consultas SQL ad hoc. Um Lambda agendado pelo EventBridge realiza o reparo automático de partições.
O repositório inclui Infraestrutura como Código usando AWS SAM e CloudFormation para implantações repetíveis e controladas por versão. Os payloads recebidos usam formato JSONL codificado em Base64, com deviceId como chave de partição do Kinesis. Os dados transformados são armazenados com particionamento por ano/mês/dia e compressão Snappy para consultas economicamente viáveis.
Considerações de produção são documentadas de forma abrangente, cobrindo otimização de taxa de ingestão, compressão no lado do cliente, tratamento de evolução de esquema, monitoramento com CloudWatch, padrões de segurança e alternativas ao reparo em lote de partições para cenários em tempo real. Os dados originais são provenientes de um dataset de clickstream do Kaggle.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.