Sobre el proyecto
Sail es un motor de cómputo distribuido de código abierto, nativo en Rust, diseñado como un sustituto directo de Apache Spark. Unifica el procesamiento por lotes, el procesamiento de flujos y las cargas de trabajo de IA intensivas en cómputo en un único motor multimodal. Sail es compatible con el protocolo Spark Connect, lo que permite que las aplicaciones PySpark existentes se conecten sin cambios de código. El motor está construido sobre Apache Arrow y Apache DataFusion, aprovechando la ejecución columnar y las instrucciones SIMD para un alto rendimiento. Soporta UDFs, UDAFs, UDWFs y UDTFs de Python con intercambio de datos de copia cero. Sail proporciona soporte nativo para los formatos de tabla Delta Lake y Apache Iceberg, y se integra con proveedores de catálogo como AWS Glue, Unity Catalog, Hive Metastore y Microsoft OneLake. Los backends de almacenamiento incluyen AWS S3, Azure, Google Cloud Storage, HDFS y más. El proyecto afirma mejoras significativas de rendimiento sobre Spark, con benchmarks derivados de TPC-H que muestran una ejecución de consultas aproximadamente 10 veces más rápida y costos de infraestructura un 98% más bajos. Sail se puede implementar localmente mediante CLI o API de Python, o en Kubernetes para procesamiento distribuido. La documentación incluye guías de instalación, guías de migración y referencias detalladas de características.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.