このプロジェクトについて
NVIDIA NeMo Speechは、音声モデルに取り組む研究者やPyTorch開発者を対象としたオープンソースフレームワークです。READMEによると、自動音声認識(ASR)、テキスト読み上げ(TTS)、音声LLMを対象としており、既存のコードと事前学習済みチェックポイントを再利用して新しいモデルを作成、カスタマイズ、デプロイするのに役立つことを目的としています。
スコープと位置付け
- リポジトリは、オーディオ、音声、マルチモーダルLLMに焦点を当てるように転換したと述べています。追加のモダリティをカバーする分割前の最終NeMoリリースはv2.7.3です。
- 現在のラインはNeMo Speech 3.0で、リリースv3.0.0として公開され、NGCコンテナで提供されています。
- モデルのチェックポイントとデモは、READMEから参照されるHuggingFaceコレクションにまとめられています。
ドキュメントとリリース
- 開発者向けドキュメントは、最新リリース(3.0.0)とナイトリーメインブランチ用にホストされています。
- READMEには、多言語TTSチェックポイント、ストリーミングASRモデル、統合オフライン/ストリーミングASR、ヨーロッパ言語向けの音声認識/翻訳モデルなどのモデルリリースを説明する日付付きの更新がリストされています。これらはリリースノートであり、独立したベンチマーク検証はここでは提供されていません。
要件
- Python 3.12以上、PyTorch 2.7以上(CPUまたはCUDA)、およびトレーニング用のNVIDIA GPU(推論には推奨)が必要です。
- プロジェクトは、既存のPython/PyTorch/CUDAスタックの上にインストールされ、それを置き換えることはないと述べています。uv.lockと公式コンテナに固定されたバージョン(Python 3.13、CUDA 12.9を備えたPyTorch 2.11、またはCUDA 13.2を備えたPyTorch 2.12)は、厳密な要件ではなく、積極的にテストされた組み合わせとして説明されています。
- PyTorch 2.6以降、torch.loadはデフォルトでweights_only=Trueになるため、一部のチェックポイントではTORCH_FORCE_NO_WEIGHTS_ONLY_LOAD=1が必要になる場合があるという注意書きがあります。これは信頼できるファイルでのみ使用すべきであり、信頼できないファイルを読み込むと任意のコード実行のリスクがあるためです。
インストールオプション
- 推奨: uvを使用してソースからインストールし、allやcu13(またはcu12)などのエクストラを同期して、テスト済みスタックを.venvに再現します。オプションのグループはテストやドキュメントを追加します。
- Docker: 事前構築されたNGCコンテナをプルするか、提供されたDockerfileからビルドします。GPU_TARGETオプションはH100+またはA100用です。
- pipフォールバック: 最初にPyTorchをインストールし、次にasrおよびttsエクストラを指定してnemo-toolkitをインストールします。READMEは、bring-your-ownスタックにはuv sync --lockedを使用すべきではないと述べています。これはロックファイルを適用して既存のPython/PyTorch/CUDAを置き換えるためです。
- オプションの高速化バックエンド(Transformer Engine、FlashAttention、Mamba、grouped-GEMM/MoE、DeepEP)は、コンパイルされたエクストラからソースビルドされたカーネルとして説明されており、Automodelバックエンドはコンパイルされた依存関係なしで実行できます。
ライセンスと貢献
- Apache License 2.0の下でライセンスされています。
- コミュニティからの貢献は、CONTRIBUTING.mdプロセスを通じて歓迎されています。
この概要はリポジトリのREADMEに記載されている内容のみを反映しており、リリースノートで行われた正確性、パフォーマンス、ランキングの主張を検証するものではありません。
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.