Sobre o projeto
O NVIDIA Model Optimizer (ModelOpt) é uma biblioteca unificada de código aberto para comprimir e acelerar modelos de aprendizado profundo. Ela suporta entradas de modelos Hugging Face, PyTorch e ONNX, e exporta checkpoints quantizados otimizados prontos para implantação em frameworks como TensorRT-LLM, TensorRT, vLLM e SGLang.
As principais técnicas incluem:
- Quantização Pós-Treinamento (PTQ): Comprime modelos em 2x–4x com formatos como FP8, INT8 e NVFP4, suportando LLMs, VLMs, Diffusers e modelos ONNX.
- Treinamento Ciente de Quantização (QAT) / Destilação: Refina a precisão de modelos quantizados por meio de etapas adicionais de treinamento.
- Poda: Reduz parâmetros do modelo e uso de memória ao remover pesos desnecessários, incluindo poda heterogênea via algoritmo Puzzletron.
- Destilação: Ensina modelos menores a imitar modelos maiores para reduzir o tamanho da implantação.
- Decodificação Especulativa: Treina módulos rascunho para prever tokens extras durante a inferência, reduzindo a latência.
- Esparsidade: Comprime modelos armazenando apenas valores de parâmetros não nulos e suas localizações.
- Busca de Arquitetura Neural (NAS): Descobre arquiteturas de modelos eficientes.
A biblioteca integra-se com NVIDIA Megatron-Bridge, Megatron-LM e Hugging Face Accelerate para fluxos de otimização que exigem treinamento. Ela também fornece habilidades de agente de IA para Claude Code e Codex.
A instalação é feita via pip (`pip install -U nvidia-modelopt[all]`) ou a partir do código-fonte. Checkpoints pré-quantizados para modelos como Llama, DeepSeek-R1 e Nemotron estão disponíveis no Hugging Face. O projeto segue uma política de descontinuação estruturada com um período de migração de ~1 versão.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.