عن المشروع

Apache Spark هو محرك تحليلات موحد لمعالجة البيانات واسعة النطاق. يوفر واجهات برمجة تطبيقات (APIs) عالية المستوى بلغات Scala وJava وPython، ويدعم محركاً محسناً لمخططات حوسبة تحليل البيانات. تشمل المكونات والأدوات الرئيسية ما يلي: - Spark SQL: لـ SQL وDataFrames. - pandas API on Spark: لأعباء العمل القائمة على pandas. - MLlib: مكتبة لتعلم الآلة. - GraphX: لمعالجة الرسوم البيانية. - Structured Streaming: لمعالجة التدفقات. تم بناء Spark باستخدام Apache Maven ويدعم أوضاع نشر متنوعة، بما في ذلك التنفيذ المحلي، وYARN، وKubernetes. كما يتكامل مع مكتبات Hadoop الأساسية للتفاعل مع HDFS وأنظمة التخزين الأخرى التي يدعمها Hadoop.