À propos du projet

NVIDIA NeMo Speech est un framework open source conçu pour les chercheurs et les développeurs PyTorch travaillant sur des modèles vocaux. Selon son fichier README, il cible la reconnaissance vocale automatique (ASR), la synthèse vocale à partir de texte (TTS) et les grands modèles de langage vocaux (Speech LLMs), et vise à aider les utilisateurs à créer, personnaliser et déployer de nouveaux modèles en réutilisant du code existant et des points de contrôle pré-entraînés. Portée et positionnement - Le dépôt indique qu'il s'est recentré sur les audio, la parole et les grands modèles de langage multimodaux ; la version finale pré-séparation de NeMo couvrant d'autres modalités est la v2.7.3. - La version actuelle est NeMo Speech 3.0, publiée sous la version v3.0.0 et livrée dans un conteneur NGC. - Les points de contrôle et les démonstrations sont regroupés dans une collection HuggingFace référencée depuis le README. Documentation et versions - La documentation pour les développeurs est hébergée pour la dernière version (3.0.0) et pour la branche principale de la nuit. - Le README liste des mises à jour datées décrivant des versions de modèles telles que des points de contrôle TTS multilingues, des modèles ASR en streaming, une ASR unifiée hors ligne/en streaming, et des modèles de reconnaissance/translation vocale pour les langues européennes. Il s'agit de notes de version ; aucune vérification indépendante des benchmarks n'est fournie ici. Exigences - Python 3.12 ou supérieur, PyTorch 2.7 ou supérieur (CPU ou CUDA), et une carte graphique NVIDIA avec CUDA pour l'entraînement (recommandée pour l'inférence). - Le projet indique qu'il s'installe sur une pile existante Python/PyTorch/CUDA sans la remplacer ; les versions verrouillées dans uv.lock et le conteneur officiel (Python 3.13, PyTorch 2.11 avec CUDA 12.9 ou PyTorch 2.12 avec CUDA 13.2) sont décrites comme des combinaisons activement testées plutôt que des exigences strictes. - Une note indique que depuis PyTorch 2.6, torch.load passe par défaut à weights_only=True, et certains points de contrôle peuvent nécessiter TORCH_FORCE_NO_WEIGHTS_ONLY_LOAD=1, qui ne devrait être utilisé qu'avec des fichiers de confiance car charger des fichiers non fiables peut entraîner l'exécution de code arbitraire. Options d'installation - Recommandé : installer à partir de la source avec uv, synchronisant les extras tels que all et cu13 (ou cu12), ce qui reproduit la pile testée dans un .venv ; des groupes optionnels ajoutent des tests ou des documents. - Docker : télécharger le conteneur préconstruit NGC ou le construire à partir du Dockerfile fourni, avec des options GPU_TARGET pour H100+ ou A100. - pip en dernier recours : installer d'abord PyTorch, puis nemo-toolkit avec les extras asr et tts ; le README note que uv sync --locked ne devrait pas être utilisé pour une pile personnalisée car il applique le fichier de verrouillage et remplace la pile Python/PyTorch/CUDA existante. - Des backends accélérés optionnels (Transformer Engine, FlashAttention, Mamba, grouped-GEMM/MoE, DeepEP) sont décrits comme des noyaux construits à partir de sources à partir d'extraits compilés, avec le backend Automodel pouvant fonctionner sans dépendances compilées. Licence et contribution - Licence Apache 2.0. - Les contributions communautaires sont les bienvenues via le processus CONTRIBUTING.md. Cette présentation reflète uniquement ce que le fichier README du dépôt indique ; elle ne vérifie pas l'exactitude, les performances ou les affirmations de classement figurant dans les notes de version.