Sobre o projeto

O NVIDIA NeMo Speech é um framework de código aberto voltado a pesquisadores e desenvolvedores PyTorch que trabalham com modelos de fala. De acordo com seu README, ele tem como alvo o Reconhecimento Automático de Fala (ASR), Texto-para-Fala (TTS) e LLMs de Fala, e destina-se a ajudar usuários a criar, personalizar e implantar novos modelos reutilizando código existente e checkpoints pré-treinados. Escopo e posicionamento - O repositório afirma que mudou seu foco para LLMs de áudio, fala e multimodais; a versão final do NeMo antes da divisão, cobrindo modalidades adicionais, é a v2.7.3. - A linha atual é o NeMo Speech 3.0, publicado como release v3.0.0 e distribuído em um contêiner NGC. - Checkpoints de modelos e demonstrações estão reunidos em uma coleção HuggingFace referenciada no README. Documentação e releases - A documentação para desenvolvedores é hospedada para a versão mais recente (3.0.0) e para o branch principal nightly. - O README lista atualizações datadas descrevendo lançamentos de modelos, como checkpoints TTS multilíngues, modelos ASR em streaming, ASR unificado offline/streaming e modelos de reconhecimento/tradução de fala para línguas europeias. São notas de release; nenhuma verificação independente de benchmark é fornecida aqui. Requisitos - Python 3.12 ou superior, PyTorch 2.7 ou superior (CPU ou CUDA) e uma GPU NVIDIA com CUDA para treinamento (recomendado para inferência). - O projeto afirma que é instalado sobre uma pilha Python/PyTorch/CUDA existente sem substituí-la; as versões fixadas em uv.lock e no contêiner oficial (Python 3.13, PyTorch 2.11 com CUDA 12.9 ou PyTorch 2.12 com CUDA 13.2) são descritas como combinações testadas ativamente, e não requisitos rígidos. - Uma nota alerta que, desde o PyTorch 2.6, torch.load usa como padrão weights_only=True, e alguns checkpoints podem precisar de TORCH_FORCE_NO_WEIGHTS_ONLY_LOAD=1, que só deve ser usado com arquivos confiáveis, pois carregar arquivos não confiáveis pode arriscar execução arbitrária de código. Opções de instalação - Recomendado: instalar a partir do código-fonte com uv, sincronizando extras como all e cu13 (ou cu12), o que reproduz a pilha testada em um .venv; grupos opcionais adicionam testes ou documentação. - Docker: baixar o contêiner NGC pré-construído ou construir a partir do Dockerfile fornecido, com opções GPU_TARGET para H100+ ou A100. - Alternativa com pip: instalar o PyTorch primeiro e depois nemo-toolkit com os extras asr e tts; o README observa que uv sync --locked não deve ser usado para uma pilha própria, pois aplica o lockfile e substitui o Python/PyTorch/CUDA existente. - Backends acelerados opcionais (Transformer Engine, FlashAttention, Mamba, grouped-GEMM/MoE, DeepEP) são descritos como kernels construídos a partir de fontes via extras compilados, com o backend Automodel capaz de executar sem dependências compiladas. Licenciamento e contribuição - Licenciado sob Apache License 2.0. - Contribuições da comunidade são bem-vindas por meio do processo descrito em CONTRIBUTING.md. Esta visão geral reflete apenas o que o README do repositório declara; não verifica exatidão, desempenho ou alegações de classificação feitas nas notas de release.