Об этом проекте
NVIDIA Model Optimizer (ModelOpt) — это унифицированная открытая библиотека для сжатия и ускорения моделей глубокого обучения. Она поддерживает входные модели Hugging Face, PyTorch и ONNX и экспортирует оптимизированные квантованные чекпоинты, готовые к развёртыванию в таких фреймворках, как TensorRT-LLM, TensorRT, vLLM и SGLang.
Ключевые методы:
- Post-Training Quantization (PTQ): сжимает модели в 2–4 раза с использованием форматов, включая FP8, INT8 и NVFP4, поддерживая LLM, VLM, Diffusers и модели ONNX.
- Quantization-Aware Training (QAT) / дистилляция: повышает точность квантованных моделей за счёт дополнительных шагов обучения.
- Прунинг: уменьшает число параметров модели и объём памяти за счёт удаления ненужных весов, включая гетерогенный прунинг с помощью алгоритма Puzzletron.
- Дистилляция: обучает меньшие модели имитировать большие для уменьшения размера развёртывания.
- Спекулятивное декодирование: обучает черновые модули предсказывать дополнительные токены во время инференса, снижая задержку.
- Разреженность: сжимает модели, сохраняя только ненулевые значения параметров и их местоположения.
- Neural Architecture Search (NAS): находит эффективные архитектуры моделей.
Библиотека интегрируется с NVIDIA Megatron-Bridge, Megatron-LM и Hugging Face Accelerate для рабочих процессов оптимизации, требующих обучения. Она также предоставляет навыки AI-агентов для Claude Code и Codex.
Установка выполняется через pip (`pip install -U nvidia-modelopt[all]`) или из исходного кода. Предварительно квантованные чекпоинты для таких моделей, как Llama, DeepSeek-R1 и Nemotron, доступны на Hugging Face. Проект следует структурированной политике устаревания с периодом миграции примерно в один релиз.
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.