منصوبے کے بارے میں
Apache Spark بڑے پیمانے پر ڈیٹا پروسیسنگ کے لیے ایک متحد اینالیٹکس انجن ہے۔ یہ Scala، Java، اور Python میں اعلیٰ سطح کے APIs فراہم کرتا ہے، جو ڈیٹا اینالیسس کمپیوٹیشن گراف کے لیے ایک بہتر انجن کی حمایت کرتا ہے۔
اہم اجزاء اور ٹولز میں شامل ہیں:
- Spark SQL: SQL اور DataFrames کے لیے۔
- pandas API on Spark: pandas پر مبنی ورک لوڈز کے لیے۔
- MLlib: مشین لرننگ کے لیے ایک لائبریری۔
- GraphX: گراف پروسیسنگ کے لیے۔
- Structured Streaming: اسٹریم پروسیسنگ کے لیے۔
Spark کو Apache Maven کا استعمال کرتے ہوئے بنایا گیا ہے اور یہ مختلف ڈیپلائمنٹ موڈز کی حمایت کرتا ہے، بشمول لوکل ایگزیکیوشن، YARN، اور Kubernetes۔ یہ HDFS اور دیگر Hadoop سپورٹڈ اسٹوریج سسٹمز کے ساتھ تعامل کرنے کے لیے Hadoop کور لائبریریز کے ساتھ مربوط ہوتا ہے۔