প্রকল্প সম্পর্কে
Apache Spark হলো বৃহৎ আকারের ডেটা প্রসেসিংয়ের জন্য একটি ইউনিফাইড অ্যানালিটিক্স ইঞ্জিন। এটি Scala, Java এবং Python-এ হাই-লেভেল API প্রদান করে, যা ডেটা অ্যানালাইসিস কম্পিউটেশন গ্রাফের জন্য একটি অপ্টিমাইজড ইঞ্জিন সমর্থন করে।
এর মূল উপাদান এবং টুলগুলোর মধ্যে রয়েছে:
- Spark SQL: SQL এবং DataFrames-এর জন্য।
- pandas API on Spark: pandas-ভিত্তিক ওয়ার্কলোডের জন্য।
- MLlib: মেশিন লার্নিংয়ের জন্য একটি লাইব্রেরি।
- GraphX: গ্রাফ প্রসেসিংয়ের জন্য।
- Structured Streaming: স্ট্রিম প্রসেসিংয়ের জন্য।
Spark তৈরি করা হয়েছে Apache Maven ব্যবহার করে এবং এটি লোকাল এক্সিকিউশন, YARN এবং Kubernetes সহ বিভিন্ন ডেপ্লয়মেন্ট মোড সমর্থন করে। এটি HDFS এবং অন্যান্য Hadoop-সমর্থিত স্টোরেজ সিস্টেমের সাথে ইন্টারঅ্যাক্ট করতে Hadoop কোর লাইব্রেরির সাথে ইন্টিগ্রেট করে।