Sobre o projeto
O Apache Spark é um mecanismo de análise unificado para processamento de dados em larga escala. Ele fornece APIs de alto nível em Scala, Java e Python, suportando um mecanismo otimizado para grafos de computação de análise de dados.
Os principais componentes e ferramentas incluem:
- Spark SQL: Para SQL e DataFrames.
- pandas API on Spark: Para cargas de trabalho baseadas em pandas.
- MLlib: Uma biblioteca para machine learning.
- GraphX: Para processamento de grafos.
- Structured Streaming: Para processamento de fluxo.
O Spark é construído usando Apache Maven e suporta vários modos de implantação, incluindo execução local, YARN e Kubernetes. Ele se integra com as bibliotecas core do Hadoop para interagir com o HDFS e outros sistemas de armazenamento suportados pelo Hadoop.