À propos du projet

Data Engineering Zoomcamp est un cours gratuit et open source de 9 semaines proposé par DataTalks.Club, qui enseigne les fondamentaux de l'ingénierie des données en amenant les apprenants à construire un pipeline de données de bout en bout à partir de zéro. Les supports, les cours vidéo et les devoirs sont librement disponibles dans le dépôt. Le cours s'adresse aux développeurs, analystes et data scientists qui souhaitent apprendre à construire des pipelines de données et à travailler avec une stack moderne d'ingénierie des données. Les prérequis sont une expérience de base en programmation et une familiarité avec SQL ; Python est utile mais non obligatoire, et aucune expérience préalable en ingénierie des données n'est requise. Il peut être suivi de deux manières. Une cohorte en direct fonctionne avec des échéances, des devoirs notés, un classement, une revue par les pairs et l'éligibilité à un certificat ; les cours sont préenregistrés, donc « en direct » désigne la structure de la cohorte plutôt que des classes en direct. Les apprenants en autonomie peuvent commencer à tout moment et utiliser les mêmes supports, avec les devoirs disponibles mais non notés et sans certificat. Le programme est organisé en modules et ateliers : - Module 1 : Conteneurisation et Infrastructure as Code — introduction à GCP, Docker et Docker Compose, exécution de PostgreSQL avec Docker, et configuration de l'infrastructure avec Terraform. - Module 2 : Orchestration des workflows — lacs de données et orchestration des workflows, avec Kestra. - Atelier 1 : Ingestion de données — lecture d'API, scalabilité des pipelines, normalisation des données et chargement incrémental, avec dlt. - Module 3 : Entrepôt de données — introduction à BigQuery, partitionnement, clustering et bonnes pratiques, plus le machine learning dans BigQuery. - Module 4 : Analytics Engineering — analytics engineering et modélisation des données, dbt avec DuckDB et BigQuery, tests, documentation et déploiement. - Module 5 : Plateformes de données — construction de pipelines de bout en bout avec Bruin, couvrant l'ingestion, la transformation et la qualité, et le déploiement dans le cloud (BigQuery). - Module 6 : Traitement par lots — Apache Spark, DataFrames et SQL, et les rouages de GroupBy et des jointures. - Module 7 : Streaming — Kafka, Kafka Streams et KSQL, et gestion des schémas avec Avro. Un projet final applique les concepts dans un scénario réel et inclut un processus de revue par les pairs et de retour d'expérience. Les certificats sont décernés aux apprenants qui terminent le projet final pendant une cohorte en direct. Le dépôt renvoie également à une playlist de cours YouTube, à la documentation du cours, à une plateforme de cours pour les échéances et les devoirs, à un canal Slack pour les discussions et le dépannage, aux annonces Telegram et à une FAQ. Les instructeurs listés incluent Alexey Grigorev, Michael Shoemaker, Will Russell, Anna Geller, Juan Manuel Perafan et Arsalan Noorafkan, avec plusieurs anciens instructeurs également crédités. Les sponsors du cours incluent Kestra, Bruin et dltHub. Le projet fait partie de DataTalks.Club, une communauté mondiale en ligne dédiée aux données qui organise des événements et des cours gratuits.