इस प्रोजेक्ट के बारे में
Sail एक ओपन-सोर्स, Rust-नेटिव वितरित कंप्यूट इंजन है जिसे Apache Spark के ड्रॉप-इन विकल्प के रूप में डिज़ाइन किया गया है। यह बैच प्रोसेसिंग, स्ट्रीम प्रोसेसिंग और कंप्यूट-गहन AI वर्कलोड को एक ही मल्टीमॉडल इंजन पर एकीकृत करता है। Sail Spark Connect प्रोटोकॉल के साथ संगत है, जिससे मौजूदा PySpark एप्लिकेशन बिना कोड बदलाव के कनेक्ट कर सकते हैं। यह इंजन Apache Arrow और Apache DataFusion पर बना है, जो उच्च प्रदर्शन के लिए कॉलमर एक्ज़ीक्यूशन और SIMD निर्देशों का लाभ उठाता है। यह शून्य-कॉपी डेटा साझाकरण के साथ Python UDFs, UDAFs, UDWFs और UDTFs का समर्थन करता है। Sail Delta Lake और Apache Iceberg टेबल फॉर्मेट के लिए नेटिव समर्थन प्रदान करता है, और AWS Glue, Unity Catalog, Hive Metastore और Microsoft OneLake जैसे कैटलॉग प्रदाताओं के साथ एकीकृत होता है। स्टोरेज बैकएंड में AWS S3, Azure, Google Cloud Storage, HDFS और अन्य शामिल हैं। परियोजना Spark की तुलना में महत्वपूर्ण प्रदर्शन सुधार का दावा करती है, व्युत्पन्न TPC-H बेंचमार्क लगभग 10 गुना तेज़ क्वेरी निष्पादन और 98% कम इंफ्रास्ट्रक्चर लागत दिखाते हैं। Sail को CLI या Python API के माध्यम से स्थानीय रूप से, या वितरित प्रोसेसिंग के लिए Kubernetes पर तैनात किया जा सकता है। दस्तावेज़ीकरण में इंस्टॉलेशन गाइड, माइग्रेशन गाइड और विस्तृत फीचर संदर्भ शामिल हैं।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.