Об этом проекте
NVIDIA NeMo Speech — это открытый фреймворк, ориентированный на исследователей и разработчиков PyTorch, работающих над моделями речи. Согласно его README, он нацелен на автоматическое распознавание речи (ASR), синтез речи из текста (TTS) и речевые LLM, и предназначен для помощи пользователям в создании, настройке и развертывании новых моделей за счёт повторного использования существующего кода и предобученных чекпоинтов.
Область и позиционирование
- В репозитории указано, что он переориентировался на фокус на аудио, речь и мультимодальные LLM; последний предварительный релиз NeMo перед разделением, охватывающий дополнительные модальности, — v2.7.3.
- Текущая линия — NeMo Speech 3.0, опубликованная как релиз v3.0.0 и поставляемая в контейнере NGC.
- Чекпоинты моделей и демо собраны в коллекции HuggingFace, на которую ссылается README.
Документация и релизы
- Документация для разработчиков размещена для последнего релиза (3.0.0) и для ветки main ночной сборки.
- В README перечислены датированные обновления, описывающие релизы моделей, такие как мультиязычные чекпоинты TTS, потоковые модели ASR, унифицированные офлайн/потоковые ASR, а также модели распознавания/перевода речи для европейских языков. Это примечания к релизу; здесь нет независимой проверки бенчмарков.
Требования
- Python 3.12 или выше, PyTorch 2.7 или выше (CPU или CUDA), и NVIDIA GPU с CUDA для обучения (рекомендуется для вывода).
- В проекте говорится, что он устанавливается поверх существующего стека Python/PyTorch/CUDA без его замены; версии, зафиксированные в uv.lock и в официальном контейнере (Python 3.13, PyTorch 2.11 с CUDA 12.9 или PyTorch 2.12 с CUDA 13.2), описываются как активно протестированные комбинации, а не как жёсткие требования.
- Примечание предупреждает, что начиная с PyTorch 2.6 torch.load по умолчанию использует weights_only=True, и некоторые чекпоинты могут требовать TORCH_FORCE_NO_WEIGHTS_ONLY_LOAD=1, который следует использовать только с доверенными файлами, поскольку загрузка ненадёжных файлов может привести к произвольному выполнению кода.
Варианты установки
- Рекомендуется: установить из исходного кода с помощью uv, синхронизировав extras такие как all и cu13 (или cu12), что воспростит протестированный стек в .venv; дополнительные группы добавляют тесты или документацию.
- Docker: скачать предварительно собранный контейнер NGC или собрать из предоставленного Dockerfile, с параметрами GPU_TARGET для H100+ или A100.
- Резервный вариант pip: сначала установить PyTorch, затем nemo-toolkit с extras asr и tts; в README отмечается, что uv sync --locked не следует использовать для собственного стека, поскольку он применяет lockfile и заменяет существующий стек Python/PyTorch/CUDA.
- Опциональные ускоренные бэкенды (Transformer Engine, FlashAttention, Mamba, grouped-GEMM/MoE, DeepEP) описываются как ядра, построенные из исходного кода из скомпилированных extras, а бэкенд Automodel способен работать без скомпилированных зависимостей.
Лицензирование и вклад
- Лицензирован под лицензией Apache License 2.0.
- Вклад сообщества приветствуется через процесс, описанный в CONTRIBUTING.md.
Этот обзор отражает только то, что указано в README репозитория; он не проверяет точность, производительность или утверждения о ранжировании, сделанные в примечаниях к релизам.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.