প্রকল্প সম্পর্কে
H2O-3 হলো H2O ওপেন-সোর্স মেশিন লার্নিং প্ল্যাটফর্মের তৃতীয় প্রজন্ম, যা ডিস্ট্রিবিউটেড ও স্কেলেবল মডেল ট্রেনিংয়ের জন্য একটি ইন-মেমরি সিস্টেম হিসেবে ডিজাইন করা হয়েছে। এটি R, Python, Scala, Java, JSON এবং Flow নোটবুক/ওয়েব UI-সহ পরিচিত ইন্টারফেস প্রদান করে এবং Hadoop ও Spark-এর মতো বিগ ডেটা প্রযুক্তির সঙ্গে কাজ করার জন্য ডকুমেন্টেড।
README-তে বর্ণিত অ্যালগরিদম কভারেজের মধ্যে রয়েছে Generalized Linear Models (elastic net সহ GLM), Gradient Boosting Machines (XGBoost সহ), Random Forests, Deep Neural Networks, Stacked Ensembles, Naive Bayes, Generalized Additive Models (GAM), Cox Proportional Hazards, K-Means, PCA এবং Word2Vec, সঙ্গে একটি সম্পূর্ণ স্বয়ংক্রিয় মেশিন লার্নিং ওয়ার্কফ্লো (H2O AutoML)। প্ল্যাটফর্মটি এক্সটেনসিবল হিসেবে বর্ণিত, তাই ডেভেলপাররা ডেটা ট্রান্সফরমেশন ও কাস্টম অ্যালগরিদম যোগ করতে পারেন এবং সমর্থিত ক্লায়েন্টের মাধ্যমে সেগুলো অ্যাক্সেস করতে পারেন।
মডেলগুলো সংরক্ষণ করে আবার H2O মেমরিতে লোড করা যায় স্কোরিংয়ের জন্য, অথবা প্রোডাকশন পরিবেশে দ্রুত স্কোরিংয়ের জন্য POJO বা MOJO ফরম্যাটে এক্সপোর্ট করা যায়। বেশিরভাগ ব্যবহারকারীর জন্য ইনস্টলেশন হয় প্রি-বিল্ট প্যাকেজের মাধ্যমে: Python-এর জন্য `pip install h2o` অথবা R-এর জন্য `install.packages("h2o")`, সঙ্গে ডাউনলোড পেজ থেকে অতিরিক্ত stable, nightly, Hadoop এবং Sparkling Water রিলিজ পাওয়া যায়। Java আর্টিফ্যাক্টগুলো একটি বিল্ড-নির্দিষ্ট Maven রিপোজিটরিতে প্রকাশিত হয়, এবং stable আর্টিফ্যাক্টগুলো পর্যায়ক্রমে Maven Central-এ প্রকাশিত হয়, যদিও এগুলো nightly বিল্ডের চেয়ে পিছিয়ে থাকতে পারে।
সোর্স থেকে বিল্ড করতে প্রয়োজন JDK 1.8+, Node.js, Gradle, Python এবং R। রিপোজিটরি একটি Gradle wrapper এবং কয়েকটি বিল্ড রেসিপি প্রদান করে, যার মধ্যে রয়েছে টেস্ট স্কিপ করা, সম্পূর্ণ টেস্ট স্যুট চালানো, ক্লিন ও রিবিল্ড করা, শুধু ডকুমেন্টেশন বিল্ড করা, এবং একটি Makefile যাতে একটি minimal assembly অপশন আছে যা Hadoop-এর মতো ভারী ডিপেন্ডেন্সি বাদ দেয়। Windows, OS X, Ubuntu 14.04 ও 13.10, এবং CentOS 7-এর জন্য প্ল্যাটফর্ম-নির্দিষ্ট সেটআপ নির্দেশনা অন্তর্ভুক্ত, যেখানে প্রযোজ্য ক্ষেত্রে R প্যাকেজ, Python প্যাকেজ, Node.js, JDK এবং Cygwin/Rtools কভার করা হয়েছে। সম্পূর্ণ টেস্ট স্যুট চালালে পাঁচটি টেস্ট JVM শুরু হয় যা একটি H2O ক্লাস্টার গঠন করে এবং এতে কমপক্ষে 8GB RAM, বাঞ্ছনীয়ভাবে 16GB প্রয়োজন বলে উল্লেখ করা হয়েছে।
Hadoop সাপোর্ট বিল্ড করা যায় BUILD_HADOOP=1 সেট করে এবং build ও dist টাস্ক চালিয়ে, যা একটি target ডিরেক্টরির অধীনে ডিস্ট্রিবিউশন zip ফাইল তৈরি করে; H2O_TARGET নির্বাচিত ডিস্ট্রিবিউশনে বিল্ড সীমিত করতে পারে। README-তে একটি নতুন Hadoop সংস্করণের জন্য সাপোর্ট যোগ করাও ডকুমেন্টেড এবং এর Java API-এর মাধ্যমে Hadoop secure user impersonation উল্লেখ করা হয়েছে। বিল্ড করার পর, ক্লাস্টার লোকালি শুরু করা যায় `java -jar build/h2o.jar` দিয়ে, যেখানে -Xmx, -nthreads এবং -ip-এর মতো JVM ও H2O স্টার্টআপ অপশন ইউজার গাইডে কভার করা হয়েছে।
তালিকাভুক্ত কমিউনিটি রিসোর্সের মধ্যে রয়েছে বাগ রিপোর্ট ও ফিচার রিকোয়েস্টের জন্য GitHub issues, কোড ও সফটওয়্যার প্রশ্নের জন্য Stack Overflow, অ্যালগরিদম ও থিওরি প্রশ্নের জন্য Cross Validated, নন-কোড প্রশ্নের জন্য h2ostream Google Group, এবং একটি Gitter ডেভেলপার চ্যাট। ডকুমেন্টেশন হোস্ট করা হয় docs.h2o.ai-তে, সঙ্গে একটি nightly build পেজ এবং কমিউনিটি প্রজেক্টের জন্য একটি Awesome H2O রিপোজিটরি। README-তে প্রাইভেসি ও টেলিমেট্রি তথ্য এবং সাইটেশন নির্দেশনাও উল্লেখ করা হয়েছে।
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.