প্রকল্প সম্পর্কে

NVIDIA Model Optimizer (ModelOpt) হলো ডিপ লার্নিং মডেল কমপ্রেস ও অ্যাক্সিলারেট করার জন্য একটি সমন্বিত ওপেন-সোর্স লাইব্রেরি। এটি Hugging Face, PyTorch এবং ONNX মডেল ইনপুট সমর্থন করে এবং TensorRT-LLM, TensorRT, vLLM এবং SGLang-এর মতো ফ্রেমওয়ার্কে ডিপ্লয়মেন্টের জন্য প্রস্তুত অপটিমাইজড কোয়ান্টাইজড চেকপয়েন্ট এক্সপোর্ট করে। প্রধান কৌশলগুলোর মধ্যে রয়েছে: - Post-Training Quantization (PTQ): FP8, INT8 এবং NVFP4 ফরম্যাটসহ মডেল 2x–4x কমপ্রেস করে, যা LLM, VLM, Diffusers এবং ONNX মডেল সমর্থন করে। - Quantization-Aware Training (QAT) / Distillation: অতিরিক্ত ট্রেনিং ধাপের মাধ্যমে কোয়ান্টাইজড মডেলের নির্ভুলতা উন্নত করে। - Pruning: অপ্রয়োজনীয় ওয়েট অপসারণ করে মডেল প্যারামিটার ও মেমরি ফুটপ্রিন্ট হ্রাস করে, যার মধ্যে Puzzletron অ্যালগরিদমের মাধ্যমে হেটেরোজিনিয়াস প্রুনিং অন্তর্ভুক্ত। - Distillation: ডিপ্লয়মেন্ট সাইজ কমাতে ছোট মডেলকে বড় মডেলের অনুকরণ শেখায়। - Speculative Decoding: ইনফারেন্সের সময় অতিরিক্ত টোকেন পূর্বাভাস দিতে ড্রাফট মডিউল ট্রেন করে, যা লেটেন্সি হ্রাস করে। - Sparsity: শুধুমাত্র নন-জিরো প্যারামিটার মান ও তাদের অবস্থান সংরক্ষণ করে মডেল কমপ্রেস করে। - Neural Architecture Search (NAS): দক্ষ মডেল আর্কিটেকচার আবিষ্কার করে। লাইব্রেরিটি ট্রেনিং-প্রয়োজনীয় অপটিমাইজেশন ওয়ার্কফ্লোর জন্য NVIDIA Megatron-Bridge, Megatron-LM এবং Hugging Face Accelerate-এর সাথে ইন্টিগ্রেট করে। এটি Claude Code এবং Codex-এর জন্য AI এজেন্ট স্কিলও প্রদান করে। ইনস্টলেশন pip-এর মাধ্যমে (`pip install -U nvidia-modelopt[all]`) অথবা সোর্স থেকে করা যায়। Llama, DeepSeek-R1 এবং Nemotron-এর মতো মডেলের প্রি-কোয়ান্টাইজড চেকপয়েন্ট Hugging Face-এ পাওয়া যায়। প্রকল্পটি ~1-রিলিজ মাইগ্রেশন পিরিয়ডসহ একটি সুসংগঠিত ডেপ্রিকেশন পলিসি অনুসরণ করে।