Sobre el proyecto

Apache Spark es un motor de análisis unificado para el procesamiento de datos a gran escala. Proporciona APIs de alto nivel en Scala, Java y Python, admitiendo un motor optimizado para grafos de computación de análisis de datos. Los componentes y herramientas clave incluyen: - Spark SQL: Para SQL y DataFrames. - pandas API on Spark: Para cargas de trabajo basadas en pandas. - MLlib: Una biblioteca para aprendizaje automático. - GraphX: Para el procesamiento de grafos. - Structured Streaming: Para el procesamiento de flujos. Spark está construido utilizando Apache Maven y admite varios modos de despliegue, incluyendo la ejecución local, YARN y Kubernetes. Se integra con las bibliotecas principales de Hadoop para interactuar con HDFS y otros sistemas de almacenamiento compatibles con Hadoop.