프로젝트 소개
Sail은 Apache Spark의 드롭인 대체품으로 설계된 오픈 소스 Rust 네이티브 분산 컴퓨팅 엔진입니다. 단일 멀티모달 엔진에서 배치 처리, 스트림 처리, 컴퓨팅 집약적인 AI 워크로드를 통합합니다. Sail은 Spark Connect 프로토콜과 호환되므로 기존 PySpark 애플리케이션이 코드 변경 없이 연결할 수 있습니다. 이 엔진은 Apache Arrow와 Apache DataFusion을 기반으로 구축되어 컬럼형 실행과 SIMD 명령어를 활용해 높은 성능을 제공합니다. 제로 카피 데이터 공유를 통해 Python UDF, UDAF, UDWF, UDTF를 지원합니다. Sail은 Delta Lake 및 Apache Iceberg 테이블 형식을 기본 지원하며 AWS Glue, Unity Catalog, Hive Metastore, Microsoft OneLake와 같은 카탈로그 제공자와 통합됩니다. 스토리지 백엔드에는 AWS S3, Azure, Google Cloud Storage, HDFS 등이 포함됩니다. 이 프로젝트는 Spark 대비 상당한 성능 향상을 주장하며, 파생된 TPC-H 벤치마크에서 약 10배 빠른 쿼리 실행과 98% 낮은 인프라 비용을 보여줍니다. Sail은 CLI 또는 Python API를 통해 로컬로 배포하거나 분산 처리를 위해 Kubernetes에 배포할 수 있습니다. 문서에는 설치 가이드, 마이그레이션 가이드, 상세 기능 참조가 포함되어 있습니다.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.