প্রকল্প সম্পর্কে
Data Engineering Zoomcamp হলো DataTalks.Club-এর একটি বিনামূল্যে, ওপেন-সোর্স ৯-সপ্তাহের কোর্স, যা শিক্ষার্থীদের শূন্য থেকে একটি এন্ড-টু-এন্ড ডেটা পাইপলাইন তৈরি করানোর মাধ্যমে ডেটা ইঞ্জিনিয়ারিংয়ের মূল বিষয়গুলো শেখায়। রিপোজিটরিতে কোর্সের উপকরণ, ভিডিও লেকচার এবং হোমওয়ার্ক বিনামূল্যে পাওয়া যায়।
এই কোর্সটি এমন ডেভেলপার, অ্যানালিস্ট এবং ডেটা সায়েন্টিস্টদের জন্য যারা ডেটা পাইপলাইন তৈরি করা এবং একটি আধুনিক ডেটা ইঞ্জিনিয়ারিং স্ট্যাক নিয়ে কাজ করা শিখতে চান। পূর্বশর্ত হলো মৌলিক কোডিং অভিজ্ঞতা এবং SQL-এর সাথে পরিচিতি; Python জানা সহায়ক কিন্তু বাধ্যতামূলক নয়, এবং পূর্বে ডেটা ইঞ্জিনিয়ারিংয়ের অভিজ্ঞতার প্রয়োজন নেই।
এটি দুটি উপায়ে অনুসরণ করা যায়। একটি লাইভ কোহোর্ট ডেডলাইন, গ্রেড করা হোমওয়ার্ক, লিডারবোর্ড, পিয়ার রিভিউ এবং সার্টিফিকেট পাওয়ার যোগ্যতা নিয়ে চলে; লেকচার আগে থেকেই রেকর্ড করা থাকে, তাই "লাইভ" বলতে লাইভ ক্লাস নয় বরং কোহোর্ট কাঠামোকে বোঝায়। সেলফ-পেসড শিক্ষার্থীরা যেকোনো সময় শুরু করতে পারেন এবং একই উপকরণ ব্যবহার করতে পারেন, যেখানে হোমওয়ার্ক পাওয়া যায় কিন্তু স্কোর করা হয় না এবং সার্টিফিকেট দেওয়া হয় না।
সিলেবাসটি মডিউল এবং ওয়ার্কশপে সাজানো:
- মডিউল ১: কন্টেইনারাইজেশন এবং Infrastructure as Code — GCP, Docker এবং Docker Compose-এর পরিচিতি, Docker দিয়ে PostgreSQL চালানো, এবং Terraform দিয়ে ইনফ্রাস্ট্রাকচার সেটআপ।
- মডিউল ২: ওয়ার্কফ্লো অর্কেস্ট্রেশন — ডেটা লেক এবং ওয়ার্কফ্লো অর্কেস্ট্রেশন, Kestra দিয়ে।
- ওয়ার্কশপ ১: ডেটা ইনজেশন — API রিডিং, পাইপলাইন স্কেলেবিলিটি, ডেটা নরমালাইজেশন এবং ইনক্রিমেন্টাল লোডিং, dlt ব্যবহার করে।
- মডিউল ৩: ডেটা ওয়্যারহাউজিং — BigQuery-এর পরিচিতি, পার্টিশনিং, ক্লাস্টারিং এবং সেরা অনুশীলন, সাথে BigQuery-তে মেশিন লার্নিং।
- মডিউল ৪: অ্যানালিটিক্স ইঞ্জিনিয়ারিং — অ্যানালিটিক্স ইঞ্জিনিয়ারিং এবং ডেটা মডেলিং, DuckDB ও BigQuery-সহ dbt, টেস্টিং, ডকুমেন্টেশন এবং ডিপ্লয়মেন্ট।
- মডিউল ৫: ডেটা প্ল্যাটফর্ম — Bruin দিয়ে এন্ড-টু-এন্ড পাইপলাইন তৈরি, যেখানে ইনজেশন, ট্রান্সফরমেশন ও কোয়ালিটি, এবং ক্লাউডে (BigQuery) ডিপ্লয়মেন্ট কভার করা হয়।
- মডিউল ৬: ব্যাচ প্রসেসিং — Apache Spark, DataFrames এবং SQL, এবং GroupBy ও জয়েনের অভ্যন্তরীণ কার্যপ্রণালী।
- মডিউল ৭: স্ট্রিমিং — Kafka, Kafka Streams এবং KSQL, এবং Avro দিয়ে স্কিমা ম্যানেজমেন্ট।
একটি চূড়ান্ত প্রকল্প বাস্তব-জগতের পরিস্থিতিতে ধারণাগুলো প্রয়োগ করে এবং এতে পিয়ার রিভিউ ও ফিডব্যাক প্রক্রিয়া অন্তর্ভুক্ত। লাইভ কোহোর্ট চলাকালীন চূড়ান্ত প্রকল্প সম্পন্ন করা শিক্ষার্থীদের সার্টিফিকেট দেওয়া হয়।
রিপোজিটরিতে একটি YouTube লেকচার প্লেলিস্ট, কোর্স ডকুমেন্টেশন, ডেডলাইন ও হোমওয়ার্কের জন্য একটি কোর্স প্ল্যাটফর্ম, আলোচনা ও সমস্যা সমাধানের জন্য একটি Slack চ্যানেল, Telegram ঘোষণা, এবং একটি FAQ-এর লিংকও রয়েছে। উল্লিখিত প্রশিক্ষকদের মধ্যে রয়েছেন Alexey Grigorev, Michael Shoemaker, Will Russell, Anna Geller, Juan Manuel Perafan এবং Arsalan Noorafkan, সাথে বেশ কয়েকজন পূর্ববর্তী প্রশিক্ষকেরও কৃতিত্ব দেওয়া হয়েছে। কোর্স স্পনসরদের মধ্যে রয়েছে Kestra, Bruin এবং dltHub। প্রকল্পটি DataTalks.Club-এর অংশ, একটি বৈশ্বিক অনলাইন ডেটা কমিউনিটি যা ইভেন্ট এবং বিনামূল্যে কোর্স আয়োজন করে।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.