প্রকল্প সম্পর্কে

LimiX একটি ওপেন-সোর্স প্রকল্প যা স্ট্রাকচার্ড (ট্যাবুলার) ডেটার জন্য বৃহৎ ফাউন্ডেশন মডেল সরবরাহ করে, যা LDM নামে পরিচিত। রিপোজিটরিটি LimiX মডেল পরিবারের জন্য ইনফারেন্স কোড এবং প্রিট্রেইনড চেকপয়েন্ট প্রকাশ করে, যার মধ্যে রয়েছে LimiX-2 (400M প্যারামিটার), LimiX-2M (2M) এবং LimiX-16M (16M)। মূল ক্ষমতা: একটি একক প্রিট্রেইনড মডেল এক ফরোয়ার্ড পাসে ক্লাসিফিকেশন, রিগ্রেশন এবং মিসিং-ভ্যালু ইমপিউটেশন সম্পাদন করে, টাস্ক-নির্দিষ্ট প্যারামিটার আপডেট ছাড়াই। LimiX-2 একটি কনটেক্সচুয়াল মেকানিজম নেটওয়ার্ক (CMN) প্যারাডাইম ব্যবহার করে যা কনটেক্সট-কন্ডিশনাল মাস্কড মডেলিং দিয়ে প্রিট্রেইন করা হয়, যা প্রচলিত ট্যাবুলার প্রায়র-ফিটেড নেটওয়ার্কের টার্গেট-কেন্দ্রিক p(y | x, D_context) অবজেক্টিভের পরিবর্তে একটি যৌথ উপস্থাপনা p(x, y | D_context) শেখে। প্রিট্রেইনিং ডেটা সিন্থেটিক, যা বিভিন্ন গ্রাফ স্ট্রাকচার, কার্যকরী মেকানিজম এবং পর্যবেক্ষণ প্রক্রিয়া জুড়ে বিস্তৃত স্ট্রাকচারাল কজাল মডেল থেকে তৈরি। প্রকল্পটি জানায় যে CMN ডিজাইন কার্যকারণ সচেতনতাও তৈরি করে, যেখানে ফিচার অ্যাটেনশন সরাসরি কার্যকারণ সম্পর্ক এনকোড করে। ব্যবহার: Python >= 3.12 প্রয়োজন। ক্লোন করার পর `pip install -e .` দিয়ে ইনস্টলেশন করা হয়, সাথে ঐচ্ছিক CUDA-ম্যাচড PyTorch (torch==2.9.1 সুপারিশকৃত) এবং flash-attn হুইল। পাবলিক এন্ট্রি পয়েন্ট হলো `inference.predictor.LimiXPredictor`, যা চেকপয়েন্ট আর্কিটেকচার সংস্করণের ভিত্তিতে v1_0 বা v2_0-তে রুট করে; কনফিগ অবশ্যই মডেলের সাথে মিলতে হবে (LimiX-2 / V2.0 `*_v2.json` ব্যবহার করে)। একটি কমান্ড-লাইন টুল `LimiX-infer` সরবরাহ করা হয়েছে, যার জন্য `--task_type`, `--data_dir` এবং `--model_path` প্রয়োজন। টাস্ক টাইপের মধ্যে রয়েছে Classification, Regression এবং Feature_imputation, সাথে alias cls / reg / imputation। `--data_dir` একটি বেঞ্চমার্ক রুট আশা করে যেখানে প্রতি ডেটাসেটের জন্য একটি সাবডিরেক্টরি থাকে যাতে train/test CSV (এবং ইমপিউটেশনের জন্য একটি মাস্কড CSV) থাকে, যেখানে শেষ কলামটি টার্গেট। ঐচ্ছিক ফ্ল্যাগের মধ্যে রয়েছে device (cuda বা cpu), gpuid, gpu_num_per_predictor, autobatch, show_progress এবং seed। Python API `LimiXPredictor(device, model_path, inference_config, ...)` প্রকাশ করে যার সাথে mix_precision, outlier_remove_std, softmax_temperature, average_before_softmax, categorical_features_indices, inference_with_DDP, use_data_cache এবং seed-এর মতো বিকল্প রয়েছে। এর `predict(x_train, y_train, x_test, task_type, unique_dataset_name)` ক্লাসিফিকেশনের জন্য ক্লাস প্রোবাবিলিটি, রিগ্রেশনের জন্য মূল টার্গেট স্কেলে পূর্বাভাস, বা মিসিং-ভ্যালু ইমপিউটেশনের জন্য একটি ইমপিউটেড ফিচার ম্যাট্রিক্স ফেরত দেয়। উদাহরণ স্ক্রিপ্টে ক্লাসিফিকেশন (ব্রেস্ট ক্যান্সার ডেটাসেট), রিগ্রেশন (ডায়াবেটিস ডেটাসেট) এবং মিসিং-ভ্যালু ইমপিউটেশন অন্তর্ভুক্ত। প্যাকেজড ইনফারেন্স কনফিগ retrieval এবং no-retrieval ভেরিয়েন্টের মধ্যে পার্থক্য করে: LimiX-2-এর জন্য V2.0 কনফিগ, এবং LimiX-16M ও LimiX-2M-এর জন্য retrieval/no-retrieval কনফিগ, যেখানে retrieval নির্ভুলতা উন্নত করে এবং no-retrieval দ্রুততর বলে বর্ণিত। README TabArena, TALENT এবং BCCO-তে বেঞ্চমার্ক মূল্যায়ন রিপোর্ট করে, সাথে 12.5M থেকে 406.2M প্যারামিটার কনফিগারেশন জুড়ে একটি স্কেলিং স্টাডি। এগুলো প্রকল্পের নিজস্ব রিপোর্ট করা ফলাফল; এখানে স্বাধীন যাচাইকরণ প্রদান করা হয়নি। লাইসেন্সিং: কোডটি Stable AI Technology Co., Ltd. License, Version 1.0 (সেপ্টেম্বর 2026) এর অধীনে প্রকাশিত, যা Apache License 2.0 থেকে উদ্ভূত, এবং মডেল ব্যবহার একটি অ-বাণিজ্যিক লাইসেন্সের সাপেক্ষে। arXiv পেপার, টেকনিক্যাল রিপোর্ট, একটি প্রকল্প পৃষ্ঠা, HuggingFace এবং ModelScope মডেল/ডেটাসেট হোস্টিং এবং BCCO ক্লাসিফিকেশন ও রিগ্রেশন বেঞ্চমার্ক ডেটাসেটের লিঙ্ক সরবরাহ করা হয়েছে।