Об этом проекте
Sail — это открытый движок распределённых вычислений, изначально написанный на Rust и предназначенный в качестве замены Apache Spark без изменения кода. Он объединяет пакетную обработку, потоковую обработку и ресурсоёмкие ИИ-нагрузки в одном мультимодальном движке. Sail совместим с протоколом Spark Connect, что позволяет существующим приложениям PySpark подключаться без изменений кода. Движок построен на Apache Arrow и Apache DataFusion, используя колоночное выполнение и инструкции SIMD для высокой производительности. Он поддерживает Python UDF, UDAF, UDWF и UDTF с разделением данных без копирования. Sail обеспечивает нативную поддержку табличных форматов Delta Lake и Apache Iceberg, а также интегрируется с поставщиками каталогов, такими как AWS Glue, Unity Catalog, Hive Metastore и Microsoft OneLake. Среди бэкендов хранения — AWS S3, Azure, Google Cloud Storage, HDFS и другие. Проект заявляет о значительном повышении производительности по сравнению со Spark: производные тесты TPC-H показывают примерно 10-кратное ускорение выполнения запросов и снижение затрат на инфраструктуру на 98%. Sail можно развернуть локально через CLI или Python API, либо в Kubernetes для распределённой обработки. Документация включает руководства по установке, миграции и подробные справочники по функциям.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.