منصوبے کے بارے میں

NVIDIA Model Optimizer (ModelOpt) ایک متحد اوپن سورس لائبریری ہے جو ڈیپ لرننگ ماڈلز کو کمپریس اور ایکسلریٹ کرنے کے لیے ڈیزائن کی گئی ہے۔ یہ Hugging Face، PyTorch، اور ONNX ماڈل ان پٹس کو سپورٹ کرتی ہے اور بہتر کردہ کوانٹائزڈ چیک پوائنٹس برآمد کرتی ہے جو TensorRT-LLM، TensorRT، vLLM، اور SGLang جیسے فریم ورکس میں تعیناتی کے لیے تیار ہوتے ہیں۔ اہم تکنیکیں شامل ہیں: - پوسٹ ٹریننگ کوانٹائزیشن (PTQ): ماڈلز کو 2x–4x تک کمپریس کرتی ہے، جس میں FP8، INT8، اور NVFP4 فارمیٹس شامل ہیں، اور LLMs، VLMs، Diffusers، اور ONNX ماڈلز کو سپورٹ کرتی ہے۔ - کوانٹائزیشن سے آگاہ تربیت (QAT) / ڈسٹلیشن: اضافی تربیتی مراحل کے ذریعے کوانٹائزڈ ماڈلز کی درستگی کو بہتر بناتی ہے۔ - پروننگ: غیر ضروری وزن کو ہٹا کر ماڈل کے پیرامیٹرز اور میموری کے استعمال کو کم کرتی ہے، بشمول Puzzletron الگورتھم کے ذریعے ہیٹروجینیئس پروننگ۔ - ڈسٹلیشن: چھوٹے ماڈلز کو بڑے ماڈلز کی نقل کرنے کی تربیت دیتی ہے تاکہ تعیناتی کا حجم کم ہو۔ - اسپیکولیٹو ڈی کوڈنگ: انفرنس کے دوران اضافی ٹوکنز کی پیش گوئی کے لیے ڈرافٹ ماڈیولز کی تربیت کرتی ہے، جس سے تاخیر کم ہوتی ہے۔ - اسپارسیٹی: صرف غیر صفر پیرامیٹر ویلیوز اور ان کے مقامات کو ذخیرہ کرکے ماڈلز کو کمپریس کرتی ہے۔ - نیورل آرکیٹیکچر سرچ (NAS): موثر ماڈل آرکیٹیکچرز دریافت کرتی ہے۔ لائبریری تربیت سے متعلق اصلاح کے ورک فلو کے لیے NVIDIA Megatron-Bridge، Megatron-LM، اور Hugging Face Accelerate کے ساتھ مربوط ہے۔ یہ Claude Code اور Codex کے لیے AI ایجنٹ اسکلز بھی فراہم کرتی ہے۔ انسٹالیشن pip کے ذریعے کی جاتی ہے (`pip install -U nvidia-modelopt[all]`) یا سورس سے۔ Llama، DeepSeek-R1، اور Nemotron جیسے ماڈلز کے لیے پری کوانٹائزڈ چیک پوائنٹس Hugging Face پر دستیاب ہیں۔ پروجیکٹ ایک منظم ڈیپریکیشن پالیسی پر عمل کرتا ہے جس میں تقریباً ایک ریلیز کی منتقلی کی مدت ہوتی ہے۔