このプロジェクトについて
HunyuanVideo-1.5は、Tencent Hunyuanがリリースしたオープンソースの動画生成モデルです。これは83億パラメータを持つ軽量な拡散トランスフォーマー(DiT)モデルであり、モデルオフロードを有効にすると、わずか14GBのVRAMでコンシューマー向けNVIDIA GPU上で実行できるように設計されています。リポジトリには、推論コード、モデル重み、学習コード、LoRAファインチューニングスクリプトが含まれています。
機能
- 480pおよび720pでのテキストから動画(T2V)および画像から動画(I2V)生成。出力を1080pにアップスケールする数ステップの超解像ネットワークを備えています。
- 16倍の空間圧縮と4倍の時間圧縮を備えた3D因果VAEに加え、長いシーケンスの計算を削減することを目的としたSelective and Sliding Tile Attention(SSTA)メカニズムを搭載。
- グリフ対応テキストエンコーディングによるバイリンガルプロンプト理解、およびvLLM互換エンドポイント(例ではQwen3モデルを参照)を介したオプションの自動プロンプト書き換え。
- 複数の高速化オプション:CFG蒸留モデル、ステップ蒸留モデル(480p I2V、8または12ステップ推奨)、スパースアテンション、SageAttention、フィーチャーキャッシング(deepcache、teacache、taylorcache)。FP8 GEMM推論もサポートされています。
- torchrunによる複数GPUでの分散推論。設定可能なオフロードとグループオフロードを備えています。
学習と統合
- 学習スクリプト(train.py)は、Muonオプティマイザーを使用した分散学習、FSDP、コンテキスト並列、勾配チェックポイントをサポートしています。
- 統合先には、Hugging Face Diffusers、ComfyUI(使用ガイドとコミュニティプラグイン付き)、LightX2V、Wan2GP、ComfyUI-MagCacheが含まれます。
要件
- Linux、Python 3.10以上、CUDA対応NVIDIA GPU、および使用する機能に応じたFlash Attention、Flex-Block-Attention、SageAttention、SGL-Kernelなどのアテンションライブラリのインストール。
モデル重みはHugging Faceで配布されており、480pおよび720pのT2V/I2Vバリアント、蒸留版、超解像モデルをカバーしています。一部の重み(特定のスパースおよび蒸留720pバリアントなど)は近日公開予定とされています。READMEには、プロンプトハンドブックとarXivレポートへのリンクもあります。
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.