Об этом проекте

Data Engineering Zoomcamp — это бесплатный 9-недельный курс с открытым исходным кодом от DataTalks.Club, который обучает основам инженерии данных через создание сквозного пайплайна данных с нуля. Материалы, видеолекции и домашние задания свободно доступны в репозитории. Курс рассчитан на разработчиков, аналитиков и специалистов по данным, которые хотят научиться создавать пайплайны данных и работать с современным стеком инженерии данных. Предварительные требования — базовый опыт программирования и знакомство с SQL; Python полезен, но не обязателен, а опыт в инженерии данных не требуется. Курс можно проходить двумя способами. Живая когорта проходит с дедлайнами, оцениваемыми домашними заданиями, таблицей лидеров, взаимным рецензированием и возможностью получения сертификата; лекции записаны заранее, поэтому «живой» относится к структуре когорты, а не к живым занятиям. Самостоятельные учащиеся могут начать в любое время и использовать те же материалы, при этом домашние задания доступны, но не оцениваются, и сертификат не выдается. Учебная программа организована в модули и воркшопы: - Модуль 1: Контейнеризация и инфраструктура как код — знакомство с GCP, Docker и Docker Compose, запуск PostgreSQL с Docker и настройка инфраструктуры с помощью Terraform. - Модуль 2: Оркестрация рабочих процессов — озера данных и оркестрация рабочих процессов с помощью Kestra. - Воркшоп 1: Прием данных — чтение API, масштабируемость пайплайнов, нормализация данных и инкрементальная загрузка с использованием dlt. - Модуль 3: Хранилища данных — знакомство с BigQuery, секционирование, кластеризация и лучшие практики, а также машинное обучение в BigQuery. - Модуль 4: Аналитическая инженерия — аналитическая инженерия и моделирование данных, dbt с DuckDB и BigQuery, тестирование, документация и развертывание. - Модуль 5: Платформы данных — создание сквозных пайплайнов с помощью Bruin, включая прием, трансформацию и контроль качества, а также развертывание в облаке (BigQuery). - Модуль 6: Пакетная обработка — Apache Spark, DataFrames и SQL, а также внутреннее устройство GroupBy и соединений. - Модуль 7: Потоковая обработка — Kafka, Kafka Streams и KSQL, а также управление схемами с помощью Avro. Финальный проект применяет концепции в реальном сценарии и включает взаимное рецензирование и обратную связь. Сертификаты выдаются учащимся, которые завершают финальный проект во время живой когорты. В репозитории также есть ссылки на плейлист лекций на YouTube, документацию курса, платформу курса для дедлайнов и домашних заданий, канал Slack для обсуждения и решения проблем, объявления в Telegram и FAQ. Среди преподавателей — Алексей Григорьев, Майкл Шумейкер, Уилл Рассел, Анна Геллер, Хуан Мануэль Перафан и Арсалан Нурафкан, а также указаны несколько бывших преподавателей. Спонсоры курса — Kestra, Bruin и dltHub. Проект является частью DataTalks.Club, глобального онлайн-сообщества специалистов по данным, которое организует мероприятия и бесплатные курсы.