这个项目能做什么
NVIDIA NeMo Speech 是一个面向语音模型研究人员和 PyTorch 开发者的开源框架。根据其 README,它针对自动语音识别(ASR)、文本转语音(TTS)和语音大语言模型(Speech LLMs),旨在帮助用户通过复用现有代码和预训练检查点来创建、定制和部署新模型。
范围与定位
- 该仓库声明其已转向专注于音频、语音和多模态大语言模型;拆分前最后一个涵盖其他模态的 NeMo 版本为 v2.7.3。
- 当前主线是 NeMo Speech 3.0,以 v3.0.0 版本发布,并随 NGC 容器提供。
- 模型检查点和演示收集在 README 引用的 HuggingFace collection 中。
文档与发布
- 开发者文档托管了最新版本(3.0.0)和 nightly main 分支。
- README 列出了带日期的更新,描述了模型发布,例如多语言 TTS 检查点、流式 ASR 模型、统一离线/流式 ASR,以及面向欧洲语言的语音识别/翻译模型。这些是发布说明;此处不提供独立的基准验证。
要求
- Python 3.12 或更高版本,PyTorch 2.7 或更高版本(CPU 或 CUDA),以及用于训练的 NVIDIA GPU(推理也推荐使用 CUDA)。
- 项目表示它安装在现有 Python/PyTorch/CUDA 环境之上,不会替换它们;uv.lock 和官方容器中固定的版本(Python 3.13、PyTorch 2.11 + CUDA 12.9 或 PyTorch 2.12 + CUDA 13.2)被描述为经过积极测试的组合,而非硬性要求。
- 有一条警告指出,自 PyTorch 2.6 起 torch.load 默认使用 weights_only=True,某些检查点可能需要设置 TORCH_FORCE_NO_WEIGHTS_ONLY_LOAD=1,该设置只能用于受信任的文件,因为加载不受信任的文件可能导致任意代码执行。
安装选项
- 推荐:使用 uv 从源码安装,同步 all 和 cu13(或 cu12)等 extras,这会在 .venv 中复现经过测试的环境;可选组可添加测试或文档。
- Docker:拉取预构建的 NGC 容器,或根据提供的 Dockerfile 构建,GPU_TARGET 选项支持 H100+ 或 A100。
- pip 备选:先安装 PyTorch,再安装带 asr 和 tts extras 的 nemo-toolkit;README 指出,对于自带环境,不应使用 uv sync --locked,因为它会应用锁文件并替换现有的 Python/PyTorch/CUDA。
- 可选的加速后端(Transformer Engine、FlashAttention、Mamba、grouped-GEMM/MoE、DeepEP)被描述为从编译的 extras 源码构建的内核,而 Automodel 后端可以在没有编译依赖的情况下运行。
许可与贡献
- 采用 Apache License 2.0 许可。
- 欢迎通过 CONTRIBUTING.md 流程提交社区贡献。
本概述仅反映仓库 README 的陈述;不验证发布说明中的准确性、性能或排名声明。
评论
0 评分人数达到10人后显示
登录后参与讨论。