इस प्रोजेक्ट के बारे में
Apache DataFusion एक विस्तार योग्य क्वेरी इंजन है जिसे उच्च-प्रदर्शन वाले डेटाबेस और एनालिटिक सिस्टम बनाने वाले डेवलपर्स के लिए डिज़ाइन किया गया है। Rust में लिखे गए और इन-मेमोरी फॉर्मेट के लिए Apache Arrow का उपयोग करने वाले इस इंजन में एक पूर्ण क्वेरी प्लानर और एक कॉलमनार, स्ट्रीमिंग, मल्टी-थ्रेडेड, वेक्टरकृत निष्पादन इंजन (execution engine) है।
मुख्य क्षमताओं में शामिल हैं:
- APIs: क्वेरी करने के लिए SQL और DataFrame दोनों इंटरफेस प्रदान करता है।
- डेटा सपोर्ट: CSV, Parquet, JSON और Avro फॉर्मेट के लिए इन-बिल्ट सपोर्ट।
- विस्तार क्षमता (Extensibility): डेटा स्रोतों, क्वेरी भाषाओं, फंक्शन और ऑपरेटर्स के अनुकूलन की अनुमति देता है।
- इकोसिस्टम: DataFusion Python, DataFusion Java, DataFusion Comet (Spark accelerator), और DataFusion Ballista (distributed execution) सहित उप-परियोजनाओं के साथ एकीकृत है।
यह इंजन डोमेन-विशिष्ट क्वेरी इंजन, नए डेटाबेस प्लेटफॉर्म और डेटा पाइपलाइन बनाने के लिए उपयुक्त है। इसमें कम्प्रेशन, क्रिप्टोग्राफिक एक्सप्रेशन और Parquet मॉड्यूलर एन्क्रिप्शन के लिए विभिन्न वैकल्पिक विशेषताएं शामिल हैं।