इस प्रोजेक्ट के बारे में
Apache Spark बड़े पैमाने पर डेटा प्रोसेसिंग के लिए एक एकीकृत एनालिटिक्स इंजन है। यह Scala, Java और Python में उच्च-स्तरीय API प्रदान करता है, जो डेटा विश्लेषण कंप्यूटेशन ग्राफ के लिए एक अनुकूलित इंजन का समर्थन करता है।
मुख्य घटकों और उपकरणों में शामिल हैं:
- Spark SQL: SQL और DataFrames के लिए।
- pandas API on Spark: pandas-आधारित वर्कलोड के लिए।
- MLlib: मशीन लर्निंग के लिए एक लाइब्रेरी।
- GraphX: ग्राफ प्रोसेसिंग के लिए।
- Structured Streaming: स्ट्रीम प्रोसेसिंग के लिए।
Spark को Apache Maven का उपयोग करके बनाया गया है और यह स्थानीय निष्पादन, YARN और Kubernetes सहित विभिन्न परिनियोजन मोड का समर्थन करता है। यह HDFS और अन्य Hadoop-समर्थित स्टोरेज सिस्टम के साथ इंटरैक्ट करने के लिए Hadoop कोर लाइब्रेरी के साथ एकीकृत होता है।