Sobre el proyecto
Apache Spark es un motor de análisis unificado para el procesamiento de datos a gran escala. Proporciona APIs de alto nivel en Scala, Java y Python, admitiendo un motor optimizado para grafos de computación de análisis de datos.
Los componentes y herramientas clave incluyen:
- Spark SQL: Para SQL y DataFrames.
- pandas API on Spark: Para cargas de trabajo basadas en pandas.
- MLlib: Una biblioteca para aprendizaje automático.
- GraphX: Para el procesamiento de grafos.
- Structured Streaming: Para el procesamiento de flujos.
Spark está construido utilizando Apache Maven y admite varios modos de despliegue, incluyendo la ejecución local, YARN y Kubernetes. Se integra con las bibliotecas principales de Hadoop para interactuar con HDFS y otros sistemas de almacenamiento compatibles con Hadoop.