프로젝트 소개

Apache Spark는 대규모 데이터 처리를 위한 통합 분석 엔진입니다. Scala, Java, Python으로 된 고수준 API를 제공하며, 데이터 분석 계산 그래프를 위한 최적화된 엔진을 지원합니다. 주요 구성 요소 및 도구는 다음과 같습니다: - Spark SQL: SQL 및 DataFrame용 - pandas API on Spark: pandas 기반 워크로드용 - MLlib: 머신러닝 라이브러리 - GraphX: 그래프 처리용 - Structured Streaming: 스트림 처리용 Spark는 Apache Maven을 사용하여 구축되었으며 로컬 실행, YARN, Kubernetes를 포함한 다양한 배포 모드를 지원합니다. 또한 Hadoop 코어 라이브러리와 통합되어 HDFS 및 기타 Hadoop 지원 스토리지 시스템과 상호 작용합니다.