このプロジェクトについて

SANAは、NVIDIA Labsによる高解像度の画像・動画生成向けの効率重視のオープンソースコードベースです。SANA、SANA-1.5、SANA-Sprint、SANA-Video、SANA-Video 2.0、SANA-WM、SANA-Streaming、Sol-RLを含む拡散トランスフォーマモデル群の完全な学習および推論パイプラインをまとめています。 提供内容: - 最大4K解像度のテキストから画像生成。600Mおよび1.6B規模のモデルバリアントと、多言語(英語、中国語、絵文字)でファインチューニングされたチェックポイント。 - SANA-1.5: 品質向上のための学習時および推論時の計算スケーリング。 - SANA-Sprint: sCM蒸留による1ステップ/少数ステップ生成。H100上で1024px画像あたり0.1秒と報告されています。 - SANA-VideoおよびLongSANA: Block Causal Linear Attentionを用いた動画生成。テキストから動画、テキスト画像から動画をサポート。 - SANA-Video 2.0: ハイブリッド線形/softmaxアテンションとAttention Residualsを備えた5Bおよび14Bアーキテクチャ。5B 720pチェックポイントと4ステップDMDプレビューが公開されています。 - SANA-WM: 720p、分単位の動画向けの2.6B制御可能ワールドモデルで、6-DoFカメラ制御を備えます。 - SANA-Streaming: 720p、分単位の動画向けの2Bリアルタイムストリーミング動画から動画への編集モデル。 - Sol-RL: NVFP4ロールアウトとBF16学習を用いた強化学習ポストトレーニングレシピ。SANA、FLUX.1、SD3.5-L向けのレシピを含みます。 リポジトリで説明されている主要技術には、DiTバックボーンにおける線形アテンション、潜在トークンを削減するDC-AE 32x画像圧縮、デコーダのみのテキストエンコーダ、長尺動画向けのCausal Mix-FFNを備えたBlock Causal Linear Attention、Flow-DPM-Solverサンプリング、sCM蒸留、低精度RLロールアウトが含まれます。プロジェクトは、4ビット量子化により8GB未満のVRAMのGPUでの展開が可能になると述べています。 エコシステム統合: モデルはHugging Face、diffusersパイプライン、ComfyUIノード、OpenAI互換APIを備えたSGLangサービング、Cosmos-RLポストトレーニング、Replicate APIを通じて利用できます。SANA、4-bit、ControlNet、SANA-Sprint、SANA-Video 2.0、SANA-WM、SANA-Streamingのデモがホストされています。 はじめに: リポジトリをクローンし、提供されている環境セットアップスクリプトを実行してから、文書化された推論および学習設定を使用します。READMEには、SANA-Video 2.0 5Bチェックポイントで720p動画を生成するための完全なコマンド例が含まれています。コードベースはApache 2.0の下でライセンスされています。