इस प्रोजेक्ट के बारे में
Apache Arrow विभिन्न डेटा प्रकारों के इन-मेमोरी प्रतिनिधित्व के लिए एक मानकीकृत कॉलमनार फॉर्मेट प्रदान करता है, जिससे डेटा सिस्टम डेटा को कुशलतापूर्वक स्टोर, प्रोसेस और मूव कर सकते हैं। इसमें विषम वातावरणों में तेज़ डेटा इंटरचेंज और एनालिटिक्स के लिए तकनीकों का एक सेट शामिल है।
मुख्य घटकों में शामिल हैं:
- Arrow Columnar Format: प्लेन या नेस्टेड डेटाटाइप्स के इन-मेमोरी प्रतिनिधित्व के लिए एक मानक।
- Arrow IPC Format: प्रोसेस के बीच संचार के लिए कुशल सीरियलाइजेशन।
- ADBC (Arrow Database Connectivity): डेटाबेस और क्वेरी इंजन तक पहुँचने के लिए API और ड्राइवर्स।
- Arrow Flight RPC: रिमोट सेवाओं के लिए Arrow डेटा एक्सचेंज करने का एक प्रोटोकॉल।
- Gandiva: Arrow के लिए एक LLVM-आधारित एक्सप्रेशन कंपाइलर।
यह प्रोजेक्ट C++, Python, Java, JavaScript, Rust, Go, R, Ruby, .NET, Julia और Swift सहित कई भाषाओं में लाइब्रेरी प्रदान करता है।
तकनीकी क्षमताओं में शामिल हैं:
- फ्लैट या नेस्टेड प्रकारों का समर्थन करने वाले कॉलमनार वेक्टर और टेबल जैसे कंटेनर।
- जीरो-कॉपी मेमोरी शेयरिंग के लिए रेफरेंस-काउंटेड ऑफ-हीप बफर मेमोरी मैनेजमेंट।
- लोकल और रिमोट फाइलसिस्टम के लिए IO इंटरफेस।
- Parquet और CSV जैसे सामान्य फाइल फॉर्मेट के लिए रीडर्स और राइटर्स।
- Google के FlatBuffers पर आधारित एक मेटाडेटा मैसेजिंग लेयर।