इस प्रोजेक्ट के बारे में

NVIDIA Model Optimizer (ModelOpt) डीप लर्निंग मॉडलों को संपीड़ित और त्वरित करने के लिए एक एकीकृत ओपन-सोर्स लाइब्रेरी है। यह Hugging Face, PyTorch और ONNX मॉडल इनपुट का समर्थन करती है तथा TensorRT-LLM, TensorRT, vLLM और SGLang जैसे फ़्रेमवर्क में तैनाती के लिए तैयार ऑप्टिमाइज़ किए गए क्वांटाइज़्ड चेकपॉइंट निर्यात करती है। प्रमुख तकनीकों में शामिल हैं: - पोस्ट-ट्रेनिंग क्वांटाइज़ेशन (PTQ): FP8, INT8 और NVFP4 सहित प्रारूपों के साथ मॉडलों को 2x–4x संपीड़ित करता है, जो LLM, VLM, Diffusers और ONNX मॉडल का समर्थन करता है। - क्वांटाइज़ेशन-अवेयर ट्रेनिंग (QAT) / डिस्टिलेशन: अतिरिक्त प्रशिक्षण चरणों के माध्यम से क्वांटाइज़्ड मॉडल की सटीकता को परिष्कृत करता है। - प्रूनिंग: Puzzletron एल्गोरिदम के माध्यम से विषम प्रूनिंग सहित अनावश्यक वज़न हटाकर मॉडल पैरामीटर और मेमोरी फ़ुटप्रिंट घटाता है। - डिस्टिलेशन: तैनाती का आकार घटाने के लिए छोटे मॉडलों को बड़े मॉडलों की नकल करना सिखाता है। - स्पेक्युलेटिव डिकोडिंग: इन्फ़रेंस के दौरान अतिरिक्त टोकन की भविष्यवाणी करने के लिए ड्राफ़्ट मॉड्यूल को प्रशिक्षित करता है, जिससे लेटेंसी घटती है। - स्पार्सिटी: केवल गैर-शून्य पैरामीटर मानों और उनके स्थानों को संग्रहीत करके मॉडल को संपीड़ित करता है। - न्यूरल आर्किटेक्चर सर्च (NAS): कुशल मॉडल आर्किटेक्चर खोजता है। यह लाइब्रेरी प्रशिक्षण-आवश्यक ऑप्टिमाइज़ेशन वर्कफ़्लो के लिए NVIDIA Megatron-Bridge, Megatron-LM और Hugging Face Accelerate के साथ एकीकृत होती है। यह Claude Code और Codex के लिए AI एजेंट स्किल भी प्रदान करती है। इंस्टॉलेशन pip (`pip install -U nvidia-modelopt[all]`) या सोर्स से किया जाता है। Llama, DeepSeek-R1 और Nemotron जैसे मॉडलों के लिए पूर्व-क्वांटाइज़्ड चेकपॉइंट Hugging Face पर उपलब्ध हैं। परियोजना लगभग 1-रिलीज़ माइग्रेशन अवधि के साथ एक संरचित डिप्रिकेशन नीति का पालन करती है।