这个项目能做什么
NVIDIA Model Optimizer(ModelOpt)是一个用于压缩和加速深度学习模型的统一开源库。它支持 Hugging Face、PyTorch 和 ONNX 模型输入,并导出经过优化的量化检查点,可直接部署到 TensorRT-LLM、TensorRT、vLLM 和 SGLang 等框架。
主要技术包括:
- 训练后量化(PTQ):使用 FP8、INT8 和 NVFP4 等格式将模型压缩 2 至 4 倍,支持 LLM、VLM、Diffusers 和 ONNX 模型。
- 量化感知训练(QAT)/ 蒸馏:通过额外的训练步骤提升量化模型的精度。
- 剪枝:通过移除不必要的权重来减少模型参数和内存占用,包括通过 Puzzletron 算法实现的异构剪枝。
- 蒸馏:让较小的模型模仿较大的模型,从而减小部署体积。
- 推测解码:训练草稿模块在推理期间预测额外的令牌,以降低延迟。
- 稀疏化:通过仅存储非零参数值及其位置来压缩模型。
- 神经架构搜索(NAS):发现高效的模型架构。
该库与 NVIDIA Megatron-Bridge、Megatron-LM 和 Hugging Face Accelerate 集成,用于需要训练的优化工作流。它还为 Claude Code 和 Codex 提供 AI 智能体技能。
可通过 pip(`pip install -U nvidia-modelopt[all]`)或从源码安装。Llama、DeepSeek-R1 和 Nemotron 等模型的预量化检查点可在 Hugging Face 上获取。该项目遵循结构化弃用策略,提供约 1 个版本的迁移期。
评论
0 评分人数达到10人后显示
登录后参与讨论。