इस प्रोजेक्ट के बारे में
NVIDIA Model Optimizer (ModelOpt) डीप लर्निंग मॉडलों को संपीड़ित और त्वरित करने के लिए एक एकीकृत ओपन-सोर्स लाइब्रेरी है। यह Hugging Face, PyTorch और ONNX मॉडल इनपुट का समर्थन करती है तथा TensorRT-LLM, TensorRT, vLLM और SGLang जैसे फ़्रेमवर्क में तैनाती के लिए तैयार ऑप्टिमाइज़ किए गए क्वांटाइज़्ड चेकपॉइंट निर्यात करती है।
प्रमुख तकनीकों में शामिल हैं:
- पोस्ट-ट्रेनिंग क्वांटाइज़ेशन (PTQ): FP8, INT8 और NVFP4 सहित प्रारूपों के साथ मॉडलों को 2x–4x संपीड़ित करता है, जो LLM, VLM, Diffusers और ONNX मॉडल का समर्थन करता है।
- क्वांटाइज़ेशन-अवेयर ट्रेनिंग (QAT) / डिस्टिलेशन: अतिरिक्त प्रशिक्षण चरणों के माध्यम से क्वांटाइज़्ड मॉडल की सटीकता को परिष्कृत करता है।
- प्रूनिंग: Puzzletron एल्गोरिदम के माध्यम से विषम प्रूनिंग सहित अनावश्यक वज़न हटाकर मॉडल पैरामीटर और मेमोरी फ़ुटप्रिंट घटाता है।
- डिस्टिलेशन: तैनाती का आकार घटाने के लिए छोटे मॉडलों को बड़े मॉडलों की नकल करना सिखाता है।
- स्पेक्युलेटिव डिकोडिंग: इन्फ़रेंस के दौरान अतिरिक्त टोकन की भविष्यवाणी करने के लिए ड्राफ़्ट मॉड्यूल को प्रशिक्षित करता है, जिससे लेटेंसी घटती है।
- स्पार्सिटी: केवल गैर-शून्य पैरामीटर मानों और उनके स्थानों को संग्रहीत करके मॉडल को संपीड़ित करता है।
- न्यूरल आर्किटेक्चर सर्च (NAS): कुशल मॉडल आर्किटेक्चर खोजता है।
यह लाइब्रेरी प्रशिक्षण-आवश्यक ऑप्टिमाइज़ेशन वर्कफ़्लो के लिए NVIDIA Megatron-Bridge, Megatron-LM और Hugging Face Accelerate के साथ एकीकृत होती है। यह Claude Code और Codex के लिए AI एजेंट स्किल भी प्रदान करती है।
इंस्टॉलेशन pip (`pip install -U nvidia-modelopt[all]`) या सोर्स से किया जाता है। Llama, DeepSeek-R1 और Nemotron जैसे मॉडलों के लिए पूर्व-क्वांटाइज़्ड चेकपॉइंट Hugging Face पर उपलब्ध हैं। परियोजना लगभग 1-रिलीज़ माइग्रेशन अवधि के साथ एक संरचित डिप्रिकेशन नीति का पालन करती है।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.