Об этом проекте
Apache Spark — это унифицированный аналитический движок для крупномасштабной обработки данных. Он предоставляет высокоуровневые API на Scala, Java и Python, поддерживая оптимизированный движок для графов вычислений при анализе данных.
Ключевые компоненты и инструменты включают:
- Spark SQL: для SQL и DataFrames.
- pandas API on Spark: для рабочих нагрузок на базе pandas.
- MLlib: библиотека для машинного обучения.
- GraphX: для обработки графов.
- Structured Streaming: для потоковой обработки.
Spark построен с использованием Apache Maven и поддерживает различные режимы развертывания, включая локальное выполнение, YARN и Kubernetes. Он интегрируется с основными библиотеками Hadoop для взаимодействия с HDFS и другими поддерживаемыми Hadoop системами хранения.