Sobre el proyecto
Data Engineering Zoomcamp es un curso gratuito y de código abierto de 9 semanas de DataTalks.Club que enseña los fundamentos de la ingeniería de datos haciendo que los alumnos construyan un pipeline de datos de extremo a extremo desde cero. Los materiales, las videoconferencias y las tareas están disponibles gratuitamente en el repositorio.
El curso está dirigido a desarrolladores, analistas y científicos de datos que quieran aprender a construir pipelines de datos y trabajar con un stack moderno de ingeniería de datos. Los requisitos previos son experiencia básica en programación y familiaridad con SQL; Python es útil pero no obligatorio, y no se necesita experiencia previa en ingeniería de datos.
Se puede seguir de dos maneras. Una cohorte en vivo se ejecuta con plazos, tareas calificadas, un tablero de clasificación, revisión por pares y elegibilidad para certificado; las conferencias están pregrabadas, por lo que "en vivo" se refiere a la estructura de la cohorte más que a clases en vivo. Los estudiantes a su propio ritmo pueden comenzar en cualquier momento y usar los mismos materiales, con tareas disponibles pero no calificadas y sin certificado.
El plan de estudios está organizado en módulos y talleres:
- Módulo 1: Contenedorización e Infraestructura como Código — introducción a GCP, Docker y Docker Compose, ejecución de PostgreSQL con Docker y configuración de infraestructura con Terraform.
- Módulo 2: Orquestación de Flujos de Trabajo — data lakes y orquestación de flujos de trabajo, con Kestra.
- Taller 1: Ingestión de Datos — lectura de APIs, escalabilidad de pipelines, normalización de datos y carga incremental, usando dlt.
- Módulo 3: Almacenamiento de Datos — introducción a BigQuery, particionamiento, agrupamiento en clústeres y mejores prácticas, además de machine learning en BigQuery.
- Módulo 4: Ingeniería Analítica — ingeniería analítica y modelado de datos, dbt con DuckDB y BigQuery, pruebas, documentación y despliegue.
- Módulo 5: Plataformas de Datos — construcción de pipelines de extremo a extremo con Bruin, cubriendo ingesta, transformación y calidad, y despliegue en la nube (BigQuery).
- Módulo 6: Procesamiento por Lotes — Apache Spark, DataFrames y SQL, y aspectos internos de GroupBy y joins.
- Módulo 7: Streaming — Kafka, Kafka Streams y KSQL, y gestión de esquemas con Avro.
Un proyecto final aplica los conceptos en un escenario del mundo real e incluye un proceso de revisión por pares y retroalimentación. Se otorgan certificados a los alumnos que completen el proyecto final durante una cohorte en vivo.
El repositorio también enlaza a una lista de reproducción de conferencias en YouTube, documentación del curso, una plataforma del curso para plazos y tareas, un canal de Slack para discusión y solución de problemas, anuncios de Telegram y una FAQ. Los instructores listados incluyen a Alexey Grigorev, Michael Shoemaker, Will Russell, Anna Geller, Juan Manuel Perafan y Arsalan Noorafkan, con varios instructores anteriores también acreditados. Los patrocinadores del curso incluyen a Kestra, Bruin y dltHub. El proyecto es parte de DataTalks.Club, una comunidad global de datos en línea que organiza eventos y cursos gratuitos.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.