Об этом проекте

NVIDIA Model Optimizer (ModelOpt) — это унифицированная открытая библиотека для сжатия и ускорения моделей глубокого обучения. Она поддерживает входные модели Hugging Face, PyTorch и ONNX и экспортирует оптимизированные квантованные чекпоинты, готовые к развёртыванию в таких фреймворках, как TensorRT-LLM, TensorRT, vLLM и SGLang. Ключевые методы: - Post-Training Quantization (PTQ): сжимает модели в 2–4 раза с использованием форматов, включая FP8, INT8 и NVFP4, поддерживая LLM, VLM, Diffusers и модели ONNX. - Quantization-Aware Training (QAT) / дистилляция: повышает точность квантованных моделей за счёт дополнительных шагов обучения. - Прунинг: уменьшает число параметров модели и объём памяти за счёт удаления ненужных весов, включая гетерогенный прунинг с помощью алгоритма Puzzletron. - Дистилляция: обучает меньшие модели имитировать большие для уменьшения размера развёртывания. - Спекулятивное декодирование: обучает черновые модули предсказывать дополнительные токены во время инференса, снижая задержку. - Разреженность: сжимает модели, сохраняя только ненулевые значения параметров и их местоположения. - Neural Architecture Search (NAS): находит эффективные архитектуры моделей. Библиотека интегрируется с NVIDIA Megatron-Bridge, Megatron-LM и Hugging Face Accelerate для рабочих процессов оптимизации, требующих обучения. Она также предоставляет навыки AI-агентов для Claude Code и Codex. Установка выполняется через pip (`pip install -U nvidia-modelopt[all]`) или из исходного кода. Предварительно квантованные чекпоинты для таких моделей, как Llama, DeepSeek-R1 и Nemotron, доступны на Hugging Face. Проект следует структурированной политике устаревания с периодом миграции примерно в один релиз.