عن المشروع

يوفر Apache Arrow تنسيقاً عمودياً موحداً لتمثيل أنواع البيانات المختلفة داخل الذاكرة، مما يمكن أنظمة البيانات من تخزين البيانات ومعالجتها ونقلها بكفاءة. وهو يتضمن مجموعة من التقنيات لتبادل البيانات والتحليلات السريعة عبر البيئات غير المتجانسة. تشمل المكونات الرئيسية ما يلي: - Arrow Columnar Format: معيار للتمثيل داخل الذاكرة لأنواع البيانات البسيطة أو المتداخلة. - Arrow IPC Format: تسلسل فعال للتواصل بين العمليات. - ADBC (Arrow Database Connectivity): واجهة برمجة تطبيقات ومحركات للوصول إلى قواعد البيانات ومحركات الاستعلام. - Arrow Flight RPC: بروتوكول للخدمات البعيدة لتبادل بيانات Arrow. - Gandiva: مترجم تعبيرات يعتمد على LLVM لـ Arrow. يوفر المشروع مكتبات عبر لغات متعددة، بما في ذلك C++ و Python و Java و JavaScript و Rust و Go و R و Ruby و .NET و Julia و Swift. تشمل القدرات التقنية ما يلي: - حاويات على شكل جداول ومتجهات عمودية تدعم الأنواع المسطحة أو المتداخلة. - إدارة ذاكرة تخزين مؤقت خارج الذاكرة (off-heap) تعتمد على عداد المراجع لمشاركة الذاكرة بدون نسخ (zero-copy). - واجهات إدخال وإخراج لأنظمة الملفات المحلية والبعيدة. - قارئات وكتابات لتنسيقات الملفات الشائعة مثل Parquet و CSV. - طبقة رسائل بيانات وصفية تعتمد على Google's FlatBuffers.