इस प्रोजेक्ट के बारे में
Apache Iceberg बड़े पैमाने पर एनालिटिक टेबल के लिए डिज़ाइन किया गया एक उच्च-प्रदर्शन टेबल फॉर्मेट है। यह कई प्रोसेसिंग इंजन—जिसमें Apache Spark, Trino, Apache Flink, Presto, Apache Hive और Impala शामिल हैं—को एक ही टेबल के साथ सुरक्षित और समानांतर रूप से काम करने में सक्षम बनाता है।
यह प्रोजेक्ट एक स्थिर फॉर्मेट स्पेसिफिकेशन और Java में एक रेफरेंस इम्प्लीमेंटेशन प्रदान करता है। Java लाइब्रेरी को कई मॉड्यूल में व्यवस्थित किया गया है:
- Core API और Implementation: `iceberg-api` और `iceberg-core` पब्लिक API और कोर लॉजिक प्रदान करते हैं, जिसमें Avro डेटा फाइलों के लिए सपोर्ट शामिल है।
- File Format Support: Parquet (`iceberg-parquet`), ORC (`iceberg-orc`), और Arrow (`iceberg-arrow`) के लिए वैकल्पिक मॉड्यूल।
- Integration Modules: Spark (`iceberg-spark`), Flink (`iceberg-flink`), और Hive (`iceberg-mr`) के लिए विशिष्ट इम्प्लीमेंटेशन, साथ ही एक Hive metastore इम्प्लीमेंटेशन (`iceberg-hive-metastore`) भी उपलब्ध है।
- Application Support: `iceberg-data` JVM एप्लिकेशन्स को सीधे टेबल के साथ काम करने की अनुमति देता है।
Java इम्प्लीमेंटेशन के अलावा, Iceberg इकोसिस्टम में Go, Python (PyIceberg), Rust और C++ में भी इम्प्लीमेंटेशन शामिल हैं।