À propos du projet

Apache Spark est un moteur d'analyse unifié pour le traitement de données à grande échelle. Il fournit des API de haut niveau en Scala, Java et Python, prenant en charge un moteur optimisé pour les graphes de calcul d'analyse de données. Les composants et outils clés incluent : - Spark SQL : Pour le SQL et les DataFrames. - pandas API on Spark : Pour les charges de travail basées sur pandas. - MLlib : Une bibliothèque pour l'apprentissage automatique. - GraphX : Pour le traitement de graphes. - Structured Streaming : Pour le traitement de flux. Spark est construit avec Apache Maven et prend en charge divers modes de déploiement, notamment l'exécution locale, YARN et Kubernetes. Il s'intègre aux bibliothèques cœurs de Hadoop pour interagir avec HDFS et d'autres systèmes de stockage pris en charge par Hadoop.