منصوبے کے بارے میں
Apache Arrow مختلف ڈیٹا اقسام کی ان-میموری نمائندگی کے لیے ایک معیاری کالمنر فارمیٹ فراہم کرتا ہے، جس سے ڈیٹا سسٹمز کے لیے ڈیٹا کو مؤثر طریقے سے اسٹور کرنے، پروسیس کرنے اور منتقل کرنے میں مدد ملتی ہے۔ اس میں مختلف ماحول کے درمیان تیز رفتار ڈیٹا تبادلے اور تجزیات کے لیے ٹیکنالوجیز کا ایک مجموعہ شامل ہے۔
اہم اجزاء میں شامل ہیں:
- Arrow Columnar Format: سادہ یا نیسٹڈ ڈیٹا اقسام کی ان-میموری نمائندگی کے لیے ایک معیار۔
- Arrow IPC Format: پراسیسز کے درمیان رابطے کے لیے موثر سیریلائزیشن۔
- ADBC (Arrow Database Connectivity): ڈیٹا بیسز اور کوئری انجن تک رسائی کے لیے API اور ڈرائیورز۔
- Arrow Flight RPC: ریموٹ سروسز کے لیے Arrow ڈیٹا کے تبادلے کا ایک پروٹوکول۔
- Gandiva: Arrow کے لیے ایک LLVM پر مبنی ایکسپریشن کمپائلر۔
یہ پروجیکٹ متعدد زبانوں میں لائبریریز فراہم کرتا ہے، جن میں C++, Python, Java, JavaScript, Rust, Go, R, Ruby, .NET, Julia، اور Swift شامل ہیں۔
تکنیکی صلاحیتوں میں شامل ہیں:
- کالمنر ویکٹر اور ٹیبل نما کنٹینرز جو فلیٹ یا نیسٹڈ اقسام کو سپورٹ کرتے ہیں۔
- زیرو کاپی میموری شیئرنگ کے لیے ریفرنس کاؤنٹڈ آف ہیپ بفر میموری مینجمنٹ۔
- مقامی اور ریموٹ فائل سسٹمز کے لیے IO انٹرفیس۔
- Parquet اور CSV جیسے عام فائل فارمیٹس کے لیے ریڈرز اور رائٹرز۔
- Google کے FlatBuffers پر مبنی ایک میٹا ڈیٹا میسجنگ لیئر۔