这个项目能做什么

NVIDIA NeMo Speech 是一个面向语音模型研究人员和 PyTorch 开发者的开源框架。根据其 README,它针对自动语音识别(ASR)、文本转语音(TTS)和语音大语言模型(Speech LLMs),旨在帮助用户通过复用现有代码和预训练检查点来创建、定制和部署新模型。 范围与定位 - 该仓库声明其已转向专注于音频、语音和多模态大语言模型;拆分前最后一个涵盖其他模态的 NeMo 版本为 v2.7.3。 - 当前主线是 NeMo Speech 3.0,以 v3.0.0 版本发布,并随 NGC 容器提供。 - 模型检查点和演示收集在 README 引用的 HuggingFace collection 中。 文档与发布 - 开发者文档托管了最新版本(3.0.0)和 nightly main 分支。 - README 列出了带日期的更新,描述了模型发布,例如多语言 TTS 检查点、流式 ASR 模型、统一离线/流式 ASR,以及面向欧洲语言的语音识别/翻译模型。这些是发布说明;此处不提供独立的基准验证。 要求 - Python 3.12 或更高版本,PyTorch 2.7 或更高版本(CPU 或 CUDA),以及用于训练的 NVIDIA GPU(推理也推荐使用 CUDA)。 - 项目表示它安装在现有 Python/PyTorch/CUDA 环境之上,不会替换它们;uv.lock 和官方容器中固定的版本(Python 3.13、PyTorch 2.11 + CUDA 12.9 或 PyTorch 2.12 + CUDA 13.2)被描述为经过积极测试的组合,而非硬性要求。 - 有一条警告指出,自 PyTorch 2.6 起 torch.load 默认使用 weights_only=True,某些检查点可能需要设置 TORCH_FORCE_NO_WEIGHTS_ONLY_LOAD=1,该设置只能用于受信任的文件,因为加载不受信任的文件可能导致任意代码执行。 安装选项 - 推荐:使用 uv 从源码安装,同步 all 和 cu13(或 cu12)等 extras,这会在 .venv 中复现经过测试的环境;可选组可添加测试或文档。 - Docker:拉取预构建的 NGC 容器,或根据提供的 Dockerfile 构建,GPU_TARGET 选项支持 H100+ 或 A100。 - pip 备选:先安装 PyTorch,再安装带 asr 和 tts extras 的 nemo-toolkit;README 指出,对于自带环境,不应使用 uv sync --locked,因为它会应用锁文件并替换现有的 Python/PyTorch/CUDA。 - 可选的加速后端(Transformer Engine、FlashAttention、Mamba、grouped-GEMM/MoE、DeepEP)被描述为从编译的 extras 源码构建的内核,而 Automodel 后端可以在没有编译依赖的情况下运行。 许可与贡献 - 采用 Apache License 2.0 许可。 - 欢迎通过 CONTRIBUTING.md 流程提交社区贡献。 本概述仅反映仓库 README 的陈述;不验证发布说明中的准确性、性能或排名声明。