Sobre o projeto
O NVIDIA NeMo Speech é um framework de código aberto voltado a pesquisadores e desenvolvedores PyTorch que trabalham com modelos de fala. De acordo com seu README, ele tem como alvo o Reconhecimento Automático de Fala (ASR), Texto-para-Fala (TTS) e LLMs de Fala, e destina-se a ajudar usuários a criar, personalizar e implantar novos modelos reutilizando código existente e checkpoints pré-treinados.
Escopo e posicionamento
- O repositório afirma que mudou seu foco para LLMs de áudio, fala e multimodais; a versão final do NeMo antes da divisão, cobrindo modalidades adicionais, é a v2.7.3.
- A linha atual é o NeMo Speech 3.0, publicado como release v3.0.0 e distribuído em um contêiner NGC.
- Checkpoints de modelos e demonstrações estão reunidos em uma coleção HuggingFace referenciada no README.
Documentação e releases
- A documentação para desenvolvedores é hospedada para a versão mais recente (3.0.0) e para o branch principal nightly.
- O README lista atualizações datadas descrevendo lançamentos de modelos, como checkpoints TTS multilíngues, modelos ASR em streaming, ASR unificado offline/streaming e modelos de reconhecimento/tradução de fala para línguas europeias. São notas de release; nenhuma verificação independente de benchmark é fornecida aqui.
Requisitos
- Python 3.12 ou superior, PyTorch 2.7 ou superior (CPU ou CUDA) e uma GPU NVIDIA com CUDA para treinamento (recomendado para inferência).
- O projeto afirma que é instalado sobre uma pilha Python/PyTorch/CUDA existente sem substituí-la; as versões fixadas em uv.lock e no contêiner oficial (Python 3.13, PyTorch 2.11 com CUDA 12.9 ou PyTorch 2.12 com CUDA 13.2) são descritas como combinações testadas ativamente, e não requisitos rígidos.
- Uma nota alerta que, desde o PyTorch 2.6, torch.load usa como padrão weights_only=True, e alguns checkpoints podem precisar de TORCH_FORCE_NO_WEIGHTS_ONLY_LOAD=1, que só deve ser usado com arquivos confiáveis, pois carregar arquivos não confiáveis pode arriscar execução arbitrária de código.
Opções de instalação
- Recomendado: instalar a partir do código-fonte com uv, sincronizando extras como all e cu13 (ou cu12), o que reproduz a pilha testada em um .venv; grupos opcionais adicionam testes ou documentação.
- Docker: baixar o contêiner NGC pré-construído ou construir a partir do Dockerfile fornecido, com opções GPU_TARGET para H100+ ou A100.
- Alternativa com pip: instalar o PyTorch primeiro e depois nemo-toolkit com os extras asr e tts; o README observa que uv sync --locked não deve ser usado para uma pilha própria, pois aplica o lockfile e substitui o Python/PyTorch/CUDA existente.
- Backends acelerados opcionais (Transformer Engine, FlashAttention, Mamba, grouped-GEMM/MoE, DeepEP) são descritos como kernels construídos a partir de fontes via extras compilados, com o backend Automodel capaz de executar sem dependências compiladas.
Licenciamento e contribuição
- Licenciado sob Apache License 2.0.
- Contribuições da comunidade são bem-vindas por meio do processo descrito em CONTRIBUTING.md.
Esta visão geral reflete apenas o que o README do repositório declara; não verifica exatidão, desempenho ou alegações de classificação feitas nas notas de release.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.