À propos du projet
Le guide Clickstream Analytics on AWS est une implémentation de référence complète qui vous permet de construire une plateforme de données de flux de clics full-stack sur AWS. La solution collecte les données d'événements provenant de clients web, Android, iOS, Flutter, React-Native et autres via des SDK dédiés, transporte les données via une couche d'ingestion configurable, les traite avec Spark sur EMR Serverless, les stocke dans Amazon S3, Redshift et DynamoDB, et visualise les indicateurs clés avec Amazon QuickSight.
Composants clés :
- Interface utilisateur front-end hébergée dans S3 et servie via CloudFront.
- API backend construites avec API Gateway, Lambda et protégées par Cognito ou OIDC.
- Orchestration du cycle de vie du pipeline utilisant Step Functions, EventBridge et CloudFormation.
- Pipeline de données comprenant ALB, ECS, Amazon MSK ou Kinesis Data Streams, S3, EMR Serverless, Redshift et QuickSight.
- SDK pour plusieurs plateformes (Android, iOS/Swift, Flutter, React-Native, Web) qui capturent automatiquement les événements courants et permettent le reporting d'événements personnalisés.
- Tableaux de bord QuickSight pré-assemblés couvrant l'acquisition, l'engagement, l'activité, la rétention, ainsi que des informations sur les appareils et la géographie.
Les prérequis incluent un OS moderne (macOS, Linux, Windows), AWS CLI, Python 3.11+, Node 20+, pnpm, Docker et un compte AWS avec AdministratorAccess. Le CDK doit être bootstrappé avant le déploiement.
Étapes de déploiement :
1. Cloner le dépôt.
2. Installer pnpm et les dépendances du projet.
3. Bootstrapper l'environnement CDK.
4. Exécuter le script de déploiement fourni (solution-deploy.sh) avec les paramètres de région, de profil et d'e-mail.
5. Une fois que CloudFormation indique CREATE_COMPLETE, ouvrir l'URL CloudFront pour accéder à la console.
Après le déploiement, vous pouvez créer des pipelines de données, enregistrer des applications, intégrer les SDK et commencer à consulter les analyses. Le guide couvre également la personnalisation (événements personnalisés, plugins de transformation de données), l'intégration avec d'autres services AWS (Personalize, SageMaker), les stratégies de mise à l'échelle et la gouvernance des données (rétention, contrôles GDPR/CCPA).
Les instructions de nettoyage conseillent de supprimer les pipelines et les applications via la console avant de supprimer les piles CloudFormation et les compartiments S3 optionnels.
Pour les développeurs, le dépôt comprend des scripts pour exécuter le plan de contrôle localement, construire le JAR ETL Spark et exécuter des tests unitaires avec pnpm. Une FAQ détaillée, les problèmes connus et des liens de dépannage sont fournis.
Dans l'ensemble, ce guide offre une solution d'analyse de flux de clics de bout en bout, de qualité production, qui peut être adaptée à un large éventail de besoins métier tout en exploitant des services AWS entièrement gérés.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.