इस प्रोजेक्ट के बारे में

यह रिपॉजिटरी डेटा इंजीनियरिंग टूल्स और संसाधनों की एक व्यापक क्यूरेटेड सूची है, जिसे स्पष्ट अनुभागों में व्यवस्थित किया गया है। इसमें रिलेशनल, की-वैल्यू, कॉलमनर, डॉक्यूमेंट, ग्राफ, डिस्ट्रीब्यूटेड और टाइम-सीरीज डेटाेस; डेटा तुलना टूल्स; Kafka, Airbyte, Meltano और dlt जैसे डेटा इनजेशन फ्रेमवर्क; HDFS, S3, Alluxio और JuiceFS सहित फाइल सिस्टम; Avro, Parquet, ORC और Protobuf जैसे सीरियलाइजेशन फॉर्मेट; स्ट्रीम और बैच प्रोसेसिंग टूल्स; चार्ट और डैशबोर्ड; वर्कफ़्लो ऑर्केस्ट्रेशन; डेटा लेक प्रबंधन; ELK स्टैक; Docker; डेटासेट; Prometheus के साथ मॉनिटरिंग; डेटा प्रोफाइलिंग; स्कीमा प्रबंधन; परीक्षण; और फोरम, सम्मेलन, पॉडकास्ट और पुस्तकों सहित सामुदायिक संसाधनों सहित विषयों की एक विस्तृत श्रृंखला शामिल है। प्रत्येक प्रविष्टि में एक संक्षिप्त विवरण और प्रोजेक्ट का लिंक शामिल है, जो इसे डेटा पाइपलान बनाने और डेटा इंफ्रास्ट्रक्चर प्रबंधित करने वाले डेवलपर्स के लिए एक व्यावहारिक संदर्भ बनाता है।