Об этом проекте

NVIDIA NeMo Speech — это открытый фреймворк, ориентированный на исследователей и разработчиков PyTorch, работающих над моделями речи. Согласно его README, он нацелен на автоматическое распознавание речи (ASR), синтез речи из текста (TTS) и речевые LLM, и предназначен для помощи пользователям в создании, настройке и развертывании новых моделей за счёт повторного использования существующего кода и предобученных чекпоинтов. Область и позиционирование - В репозитории указано, что он переориентировался на фокус на аудио, речь и мультимодальные LLM; последний предварительный релиз NeMo перед разделением, охватывающий дополнительные модальности, — v2.7.3. - Текущая линия — NeMo Speech 3.0, опубликованная как релиз v3.0.0 и поставляемая в контейнере NGC. - Чекпоинты моделей и демо собраны в коллекции HuggingFace, на которую ссылается README. Документация и релизы - Документация для разработчиков размещена для последнего релиза (3.0.0) и для ветки main ночной сборки. - В README перечислены датированные обновления, описывающие релизы моделей, такие как мультиязычные чекпоинты TTS, потоковые модели ASR, унифицированные офлайн/потоковые ASR, а также модели распознавания/перевода речи для европейских языков. Это примечания к релизу; здесь нет независимой проверки бенчмарков. Требования - Python 3.12 или выше, PyTorch 2.7 или выше (CPU или CUDA), и NVIDIA GPU с CUDA для обучения (рекомендуется для вывода). - В проекте говорится, что он устанавливается поверх существующего стека Python/PyTorch/CUDA без его замены; версии, зафиксированные в uv.lock и в официальном контейнере (Python 3.13, PyTorch 2.11 с CUDA 12.9 или PyTorch 2.12 с CUDA 13.2), описываются как активно протестированные комбинации, а не как жёсткие требования. - Примечание предупреждает, что начиная с PyTorch 2.6 torch.load по умолчанию использует weights_only=True, и некоторые чекпоинты могут требовать TORCH_FORCE_NO_WEIGHTS_ONLY_LOAD=1, который следует использовать только с доверенными файлами, поскольку загрузка ненадёжных файлов может привести к произвольному выполнению кода. Варианты установки - Рекомендуется: установить из исходного кода с помощью uv, синхронизировав extras такие как all и cu13 (или cu12), что воспростит протестированный стек в .venv; дополнительные группы добавляют тесты или документацию. - Docker: скачать предварительно собранный контейнер NGC или собрать из предоставленного Dockerfile, с параметрами GPU_TARGET для H100+ или A100. - Резервный вариант pip: сначала установить PyTorch, затем nemo-toolkit с extras asr и tts; в README отмечается, что uv sync --locked не следует использовать для собственного стека, поскольку он применяет lockfile и заменяет существующий стек Python/PyTorch/CUDA. - Опциональные ускоренные бэкенды (Transformer Engine, FlashAttention, Mamba, grouped-GEMM/MoE, DeepEP) описываются как ядра, построенные из исходного кода из скомпилированных extras, а бэкенд Automodel способен работать без скомпилированных зависимостей. Лицензирование и вклад - Лицензирован под лицензией Apache License 2.0. - Вклад сообщества приветствуется через процесс, описанный в CONTRIBUTING.md. Этот обзор отражает только то, что указано в README репозитория; он не проверяет точность, производительность или утверждения о ранжировании, сделанные в примечаниях к релизам.