Sobre o projeto
NeMo AutoModel é uma biblioteca de treinamento open-source sob o NVIDIA NeMo Framework, descrita como uma biblioteca SPMD nativa de PyTorch DTensor para treinamento em larga escala. Ela tem como alvo o treinamento e o ajuste fino de modelos de linguagem de grande porte, modelos de linguagem-visão, modelos de difusão e modelos de recuperação, visando apoiar tanto experimentos pequenos quanto implantações multi-GPU e multi-nó.
Características principais evidenciadas pelo README:
- Suporte Hugging Face pronto para uso, com receitas para muitas famílias de modelos e checkpoints.
- Paralelismo nativo do PyTorch, incluindo paralelismo de tensor, pipeline, especialista, contexto e dados, além de treinamento com sequências empacotadas.
- Métodos de ajuste fino, como SFT de parâmetros completos e LoRA/PEFT, com exemplos de receitas YAML para cargas de trabalho de LLM e VLM.
- Suporte para modelos Mixture-of-Experts, backbones de atenção híbrida e treinamento de rascunhadores para decodificação especulativa (variantes EAGLE, DFlash, DSpark).
- Exemplos de ajuste fino de difusão e texto-para-imagem, além de cobertura de modelos de recuperação.
- Documentação, páginas de cobertura de modelos, resumos de desempenho, tutoriais e habilidades orientadas a agentes no repositório.
O projeto é escrito em Python (3.10+) e é destinado a pesquisadores e engenheiros que precisam de fluxos de trabalho de treinamento reproduzíveis e escaláveis. O README enfatiza receitas, guias e exemplos em vez de alegações de benchmark.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.