منصوبے کے بارے میں
LimiX ایک اوپن سورس پروجیکٹ ہے جو ساختمانی (ٹیبلر) ڈیٹا کے لیے بڑے فاؤنڈیشن ماڈلز فراہم کرتا ہے، جنہیں LDMs کہا جاتا ہے۔ ریپوزٹری LimiX ماڈل خاندان کے لیے انفرنس کوڈ اور پریٹرینڈ چیک پوائنٹس جاری کرتی ہے، جن میں LimiX-2 (400M پیرامیٹرز)، LimiX-2M (2M) اور LimiX-16M (16M) شامل ہیں۔ بنیادی صلاحیت: ایک ہی پریٹرینڈ ماڈل ایک فارورڈ پاس میں درجہ بندی، رگریشن اور گمشدہ اقدار کی امپوٹیشن انجام دیتا ہے، بغیر کام کے مخصوص پیرامیٹر اپ ڈیٹ کے۔ LimiX-2 ایک سیاق و سباق میکانزم نیٹ ورک (CMN) پیراڈائم استعمال کرتا ہے جسے سیاق و سباق کے مشروط ماسکڈ ماڈلنگ کے ساتھ پریٹرینڈ کیا گیا ہے، جو جوائنٹ نمائندگی p(x, y | D_context) سیکھتا ہے نہ کہ روایتی ٹیبلر پہلے سے فٹ ہونے والے نیٹ ورکس کے ہدف پر مبنی p(y | x, D_context) مقصد۔ پریٹرینڈ ڈیٹا مصنوعی ہے، جو مختلف گراف ڈھانچوں، فنکشنل میکانزم اور مشاہدے کے عمل پر محیط ساختی causal ماڈلز سے تیار کیا گیا ہے۔ پروجیکٹ کا کہنا ہے کہ CMN ڈیزائن causal شعور بھی پیدا کرتا ہے، فیچر اٹینشن براہ راست causal تعلقات کو انکوڈ کرتا ہے۔ استعمال: Python >= 3.12 درکار ہے۔ کلون کرنے کے بعد `pip install -e .` کے ذریعے انسٹال کریں، اختیاری طور پر CUDA سے مماثل PyTorch (torch==2.9.1 تجویز کردہ) اور flash-attn وہیلز۔ پبلک انٹری پوائنٹ `inference.predictor.LimiXPredictor` ہے، جو چیک پوائنٹ آرکیٹیکچر ورژن کی بنیاد پر v1_0 یا v2_0 پر روٹ ہوتا ہے۔ کنفیگریشنز ماڈل سے مماثل ہونی چاہئیں (LimiX-2 / V2.0 `*_v2.json` استعمال کرتا ہے)۔ ایک کمانڈ لائن ٹول `LimiX-infer` فراہم کیا گیا ہے، جس کے لیے `--task_type`, `--data_dir` اور `--model_path` درکار ہوتے ہیں۔ کام کی اقسام میں Classification, Regression اور Feature_imputation شامل ہیں، ان کے علیاس cls / reg / imputation ہیں۔ `--data_dir` ایک بینچ مارک روٹ کی توقع رکھتا ہے جس میں ہر ڈیٹاسیٹ کے لیے ایک ذیلی ڈائریکٹری ہوتی ہے جس میں train/test CSV (اور امپوٹیشن کے لیے ایک ماسکڈ CSV) ہوتا ہے، جہاں آخری کالم ہدف ہوتا ہے۔ اختیاری فلیگ میں device (cuda یا cpu), gpuid, gpu_num_per_predictor, autobatch, show_progress اور seed شامل ہیں۔ Python API `LimiXPredictor(device, model_path, inference_config, ...)` کو ظاہر کرتا ہے جس میں mix_precision, outlier_remove_std, softmax_temperature, average_before_softmax, categorical_features_indices, inference_with_DDP, use_data_cache اور seed جیسے اختیارات ہوتے ہیں۔ اس کا `predict(x_train, y_train, x_test, task_type, unique_dataset_name)` درجہ بندی کے لیے کلاس پرویبلیٹیز، رگریشن کے لیے اصل ہدف پیمانے پر پیشین گوئیاں، یا گمشدہ اقدار کی امپوٹیشن کے لیے ایک امپوٹیڈ فیچر میٹرکس واپس کرتا ہے۔ مثال کے اسکرپٹ درجہ بندی (breast cancer ڈیٹاسیٹ)، رگریشن (diabetes ڈیٹاسیٹ) اور گمشدہ اقدار کی امپوٹیشن کا احاطہ کرتے ہیں۔ پیکیجڈ انفرنس کنفیگریشنز ریٹریول اور ریٹریول کے بغیر ویریئنٹس کو فرق کرتی ہیں: LimiX-2 کے لیے V2.0 کنفیگریشنز، اور LimiX-16M اور LimiX-2M کے لیے ریٹریول/ریٹریول کے بغیر کنفیگریشنز، جہاں ریٹریول کو درستگی بہتر کرنے کے طور پر بیان کیا گیا ہے اور ریٹریول کے بغیر تیز تر ہے۔ README TabArena, TALENT اور BCCO پر بینچ مارک تشخیصات کی اطلاع دیتا ہے، نیز 12.5M سے 406.2M پیرامیٹر کنفیگریشنز میں اسکیلنگ اسٹڈی۔ یہ پروجیکٹ کے اپنے رپورٹ کردہ نتائج ہیں؛ یہاں آزاد توثیق فراہم نہیں کی گئی ہے۔ لائسنسنگ: کوڈ Stable AI Technology Co., Ltd. لائسنس، ورژن 1.0 (ستمبر 2026) کے تحت جاری کیا گیا ہے، جو Apache لائسنس 2.0 سے ماخوذ ہے، اور ماڈل کے استعمال کے لیے غیر تجارتی لائسنس کے تابع ہے۔ arXiv پیپرز، تکنیکی رپورٹس، ایک پروجیکٹ پیج، HuggingFace اور ModelScope ماڈل/ڈیٹاسیٹ ہوسٹنگ، اور BCCO درجہ بندی اور رگریشن بینچ مارک ڈیٹاسیٹس کے لنکس فراہم کیے گئے ہیں۔
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.