Sobre o projeto
O Clickstream Analytics on AWS Guidance é uma implementação de referência abrangente que permite construir uma plataforma de dados de clickstream full-stack na AWS. A solução coleta dados de eventos de clientes web, Android, iOS, Flutter, React-Native e outros via SDKs específicos, transporta os dados através de uma camada de ingestão configurável, processa-os com Spark no EMR Serverless, armazena-os no Amazon S3, Redshift e DynamoDB, e visualiza métricas principais com o Amazon QuickSight.
Componentes principais:
- UI de front-end hospedada no S3 e servida via CloudFront.
- APIs de backend construídas com API Gateway, Lambda e protegidas por Cognito ou OIDC.
- Orquestração do ciclo de vida do pipeline usando Step Functions, EventBridge e CloudFormation.
- Pipeline de dados composto por ALB, ECS, Amazon MSK ou Kinesis Data Streams, S3, EMR Serverless, Redshift e QuickSight.
- SDKs para múltiplas plataformas (Android, iOS/Swift, Flutter, React-Native, Web) que capturam automaticamente eventos comuns e permitem o reporte de eventos personalizados.
- Dashboards do QuickSight pré-montados cobrindo aquisição, engajamento, atividade, retenção, insights de dispositivo e geografia.
Os pré-requisitos incluem um SO moderno (macOS, Linux, Windows), AWS CLI, Python 3.11+, Node 20+, pnpm, Docker e uma conta AWS com AdministratorAccess. O CDK deve ser bootstrapped antes da implantação.
Etapas de implantação:
1. Clonar o repositório.
2. Instalar o pnpm e as dependências do projeto.
3. Fazer o bootstrap do ambiente CDK.
4. Executar o script de implantação fornecido (solution-deploy.sh) com parâmetros de região, perfil e e-mail.
5. Após o CloudFormation reportar CREATE_COMPLETE, abrir a URL do CloudFront para acessar o console.
Após a implantação, você pode criar pipelines de dados, registrar aplicativos, integrar os SDKs e começar a visualizar as análises. A orientação também abrange a personalização (eventos personalizados, plugins de transformação de dados), integração com outros serviços AWS (Personalize, SageMaker), estratégias de escalonamento e governança de dados (retenção, controles GDPR/CCPA).
As instruções de limpeza recomendam a exclusão de pipelines e apps via console antes de remover as stacks do CloudFormation e buckets S3 opcionais.
Para desenvolvedores, o repositório inclui scripts para executar o control-plane localmente, buildar o JAR do Spark ETL e executar testes unitários com pnpm. FAQ detalhado, problemas conhecidos e links de solução de problemas são fornecidos.
No geral, esta orientação oferece uma solução de análise de clickstream de ponta a ponta, de nível de produção, que pode ser adaptada a uma ampla gama de necessidades de negócios, aproveitando serviços totalmente gerenciados da AWS.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.