Sobre el proyecto

NVIDIA NeMo Speech es un marco de trabajo de código abierto dirigido a investigadores y desarrolladores de PyTorch que trabajan con modelos de voz. Según su README, se centra en el Reconocimiento Automático del Habla (ASR), la Conversión de Texto a Voz (TTS) y los LLMs de voz, y está diseñado para ayudar a los usuarios a crear, personalizar y desplegar nuevos modelos reutilizando código existente y puntos de control preentrenados. Alcance y posicionamiento - El repositorio afirma que ha pivotado para centrarse en audio, voz y LLMs multimodales; la última versión de NeMo antes de la división que cubre modalidades adicionales es la v2.7.3. - La línea actual es NeMo Speech 3.0, publicada como versión v3.0.0 y distribuida en un contenedor NGC. - Los puntos de control y demos de modelos se recopilan en una colección de HuggingFace referenciada desde el README. Documentación y versiones - La documentación para desarrolladores está alojada para la última versión (3.0.0) y para la rama principal nocturna. - El README enumera actualizaciones fechadas que describen lanzamientos de modelos como puntos de control TTS multilingües, modelos ASR en streaming, ASR unificado offline/streaming, y modelos de reconocimiento/traducción de voz para lenguas europeas. Estas son notas de versión; no se proporciona aquí una verificación independiente de benchmarks. Requisitos - Python 3.12 o superior, PyTorch 2.7 o superior (CPU o CUDA), y una GPU NVIDIA con CUDA para entrenamiento (recomendado para inferencia). - El proyecto dice que se instala sobre una pila existente de Python/PyTorch/CUDA sin reemplazarla; las versiones fijadas en uv.lock y el contenedor oficial (Python 3.13, PyTorch 2.11 con CUDA 12.9 o PyTorch 2.12 con CUDA 13.2) se describen como combinaciones probadas activamente, no como requisitos estrictos. - Una nota advierte que desde PyTorch 2.6, torch.load por defecto usa weights_only=True, y algunos puntos de control pueden necesitar TORCH_FORCE_NO_WEIGHTS_ONLY_LOAD=1, que solo debe usarse con archivos de confianza porque cargar archivos no confiables puede arriesgar la ejecución de código arbitrario. Opciones de instalación - Recomendado: instalar desde el código fuente con uv, sincronizando extras como all y cu13 (o cu12), lo que reproduce la pila probada en un .venv; los grupos opcionales añaden pruebas o documentación. - Docker: extraer el contenedor NGC preconstruido o construir desde el Dockerfile proporcionado, con opciones GPU_TARGET para H100+ o A100. - Alternativa con pip: instalar primero PyTorch, luego nemo-toolkit con extras asr y tts; el README señala que uv sync --locked no debe usarse para una pila propia porque aplica el archivo de bloqueo y reemplaza el Python/PyTorch/CUDA existente. - Los backends acelerados opcionales (Transformer Engine, FlashAttention, Mamba, grouped-GEMM/MoE, DeepEP) se describen como kernels construidos desde el código fuente mediante extras compilados, con el backend Automodel capaz de ejecutarse sin dependencias compiladas. Licencia y contribución - Licenciado bajo Apache License 2.0. - Las contribuciones de la comunidad son bienvenidas a través del proceso CONTRIBUTING.md. Esta visión general refleja solo lo que declara el README del repositorio; no verifica la exactitud, el rendimiento ni las afirmaciones de clasificación hechas en las notas de versión.