프로젝트 소개
Data Engineering Zoomcamp는 DataTalks.Club에서 제공하는 무료 오픈소스 9주 과정으로, 학습자가 처음부터 엔드투엔드 데이터 파이프라인을 구축하면서 데이터 엔지니어링 기초를 배울 수 있습니다. 자료, 동영상 강의, 과제는 저장소에서 무료로 이용할 수 있습니다.
이 과정은 데이터 파이프라인을 구축하고 현대적인 데이터 엔지니어링 스택을 다루는 방법을 배우고자 하는 개발자, 분석가, 데이터 과학자를 대상으로 합니다. 선수 조건은 기본적인 코딩 경험과 SQL에 대한 친숙함이며, Python을 알면 도움이 되지만 필수는 아니고, 사전 데이터 엔지니어링 경험은 필요하지 않습니다.
두 가지 방식으로 수강할 수 있습니다. 라이브 코호트는 마감 기한, 채점되는 과제, 리더보드, 동료 평가, 수료증 자격과 함께 운영됩니다. 강의는 사전 녹화되어 있으므로 "라이브"는 실시간 수업이 아니라 코호트 구조를 의미합니다. 자기 주도 학습자는 언제든 시작해 같은 자료를 사용할 수 있으며, 과제는 이용할 수 있지만 채점되지 않고 수료증도 없습니다.
교육 과정은 모듈과 워크숍으로 구성됩니다.
- 모듈 1: 컨테이너화와 Infrastructure as Code — GCP, Docker, Docker Compose 소개, Docker로 PostgreSQL 실행, Terraform을 이용한 인프라 설정.
- 모듈 2: 워크플로 오케스트레이션 — 데이터 레이크와 워크플로 오케스트레이션, Kestra 사용.
- 워크숍 1: 데이터 수집 — API 읽기, 파이프라인 확장성, 데이터 정규화와 증분 로딩, dlt 사용.
- 모듈 3: 데이터 웨어하우징 — BigQuery 소개, 파티셔닝, 클러스터링과 모범 사례, 그리고 BigQuery에서의 머신러닝.
- 모듈 4: 분석 엔지니어링 — 분석 엔지니어링과 데이터 모델링, DuckDB와 BigQuery를 사용한 dbt, 테스트, 문서화, 배포.
- 모듈 5: 데이터 플랫폼 — Bruin으로 엔드투엔드 파이프라인 구축, 수집, 변환, 품질, 그리고 클라우드(BigQuery) 배포.
- 모듈 6: 배치 처리 — Apache Spark, DataFrames와 SQL, GroupBy와 조인의 내부 동작.
- 모듈 7: 스트리밍 — Kafka, Kafka Streams와 KSQL, Avro를 이용한 스키마 관리.
최종 프로젝트는 개념을 실제 시나리오에 적용하며 동료 평가와 피드백 과정을 포함합니다. 수료증은 라이브 코호트 중 최종 프로젝트를 완료한 학습자에게 수여됩니다.
저장소에는 YouTube 강의 재생목록, 과정 문서, 마감 기한과 과제를 위한 과정 플랫폼, 토론과 문제 해결을 위한 Slack 채널, Telegram 공지, FAQ 링크도 있습니다. 강사로는 Alexey Grigorev, Michael Shoemaker, Will Russell, Anna Geller, Juan Manuel Perafan, Arsalan Noorafkan이 있으며, 여러 과거 강사도 함께 기재되어 있습니다. 과정 후원사로는 Kestra, Bruin, dltHub가 있습니다. 이 프로젝트는 이벤트와 무료 과정을 조직하는 글로벌 온라인 데이터 커뮤니티인 DataTalks.Club의 일부입니다.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.