Apache Spark হলো বৃহৎ আকারের ডেটা প্রসেসিংয়ের জন্য ডিজাইন করা একটি ইউনিফাইড অ্যানালিটিক্স ইঞ্জিন, যা জেনারেল কম্পিউটেশন গ্রাফের জন্য হাই-লেভেল API এবং একটি অপ্টিমাইজড ইঞ্জিন প্রদান করে।
ওপেন সোর্স। নতুন সম্ভাবনা।
মানসম্মত ওপেন-সোর্স প্রজেক্ট আবিষ্কার করুন, বেনামে প্রজেক্ট জমা দিন এবং নিজের প্রজেক্ট দাবি করে সম্পাদনা করুন।
কৌতূহল নিয়ে ওপেন সোর্স আবিষ্কার করুন।
THE FIRST COLLECTIONডেল্টা লেক একটি ওপেন-সোর্স স্টোরেজ ফ্রেমওয়ার্ক যা লেকহাউস আর্কিটেকচার সক্ষম করে। এটি Spark, PrestoDB, Flink, Trino এবং Hive-এর মতো কম্পিউট ইঞ্জিনের সাথে সংহত হয়, নির্ভরযোগ্য ডেটা ব্যবস্থাপনার জন্য ACID ট্রানজ্যাকশন, টাইম ট্রাভেল এবং স্কিমা ইভোলিউশন প্রদান করে।
Redash হলো একটি ব্রাউজার-ভিত্তিক ডেটা এক্সপ্লোরেশন এবং ভিজ্যুয়ালাইজেশন টুল যা ব্যবহারকারীদের বিভিন্ন SQL এবং NoSQL সোর্স থেকে ডেটা কুয়েরি, ভিজ্যুয়ালাইজ এবং শেয়ার করার সুযোগ দেয়।
SQLGlot একটি বিশুদ্ধ পাইথন SQL পার্সার, ট্রান্সপাইলার, অপটিমাইজার এবং ইঞ্জিন যা ৩০টিরও বেশি ডায়ালেক্ট সমর্থন করে, ফরম্যাটিং, ক্রস-ডায়ালেক্ট অনুবাদ, AST ম্যানিপুলেশন এবং দ্রুত SQL প্রসেসিংয়ের জন্য ঐচ্ছিক C-এক্সটেনশন ত্বরণ সক্ষম করে।
Eclipse Deeplearning4J (DL4J) হলো জাভা ভার্চুয়াল মেশিনের জন্য একটি ওপেন-সোর্স গভীর শিক্ষণ ইকোসিস্টেম, যা Java, Scala, Kotlin এবং অন্যান্য ভাষায় মডেল তৈরি ও প্রশিক্ষণে সহায়তা করে। এতে ND4J, SameDiff, DataVec ইত্যাদি অন্তর্ভুক্ত।
ক্যাফকা-সহায়ক ব্রোকার (Redpanda) এবং PySpark Structured Streaming ব্যবহার করে একটি রানলেবল লোকাল রিয়েল-টাইম অ্যানালিটিক্স পাইপলাইন। ক্লিকস্ট্রিম ইভেন্ট সিমুলেট করে, ওয়াটারমার্কিং সহ উইন্ডোয়েড এগ্রিগেশন পরিচালনা করে, সবকিছু docker-compose এর মাধ্যমে।