프로젝트 소개
NVIDIA Model Optimizer(ModelOpt)는 딥러닝 모델을 압축하고 가속하기 위한 통합 오픈소스 라이브러리입니다. Hugging Face, PyTorch, ONNX 모델 입력을 지원하며 TensorRT-LLM, TensorRT, vLLM, SGLang과 같은 프레임워크에 배포할 수 있는 최적화된 양자화 체크포인트를 내보냅니다.
주요 기법은 다음과 같습니다:
- 학습 후 양자화(PTQ): FP8, INT8, NVFP4를 포함한 형식으로 모델을 2배~4배 압축하며, LLM, VLM, Diffusers, ONNX 모델을 지원합니다.
- 양자화 인식 학습(QAT) / 증류: 추가 학습 단계를 통해 양자화된 모델의 정확도를 개선합니다.
- 프루닝: 불필요한 가중치를 제거하여 모델 파라미터와 메모리 사용량을 줄이며, Puzzletron 알고리즘을 통한 이종 프루닝을 포함합니다.
- 증류: 작은 모델이 큰 모델을 모방하도록 학습시켜 배포 크기를 줄입니다.
- 추측 디코딩: 추론 중 추가 토큰을 예측하는 드래프트 모듈을 학습시켜 지연 시간을 줄입니다.
- 희소성: 0이 아닌 파라미터 값과 그 위치만 저장하여 모델을 압축합니다.
- 신경망 아키텍처 검색(NAS): 효율적인 모델 아키텍처를 탐색합니다.
이 라이브러리는 학습이 필요한 최적화 워크플로를 위해 NVIDIA Megatron-Bridge, Megatron-LM, Hugging Face Accelerate와 통합됩니다. 또한 Claude Code와 Codex를 위한 AI 에이전트 스킬을 제공합니다.
설치는 pip(`pip install -U nvidia-modelopt[all]`) 또는 소스에서 할 수 있습니다. Llama, DeepSeek-R1, Nemotron과 같은 모델의 사전 양자화된 체크포인트는 Hugging Face에서 사용할 수 있습니다. 이 프로젝트는 약 1회 릴리스의 마이그레이션 기간을 두는 체계적인 지원 중단 정책을 따릅니다.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.