このプロジェクトについて

HunyuanVideo-1.5は、Tencent Hunyuanがリリースしたオープンソースの動画生成モデルです。これは83億パラメータを持つ軽量な拡散トランスフォーマー(DiT)モデルであり、モデルオフロードを有効にすると、わずか14GBのVRAMでコンシューマー向けNVIDIA GPU上で実行できるように設計されています。リポジトリには、推論コード、モデル重み、学習コード、LoRAファインチューニングスクリプトが含まれています。 機能 - 480pおよび720pでのテキストから動画(T2V)および画像から動画(I2V)生成。出力を1080pにアップスケールする数ステップの超解像ネットワークを備えています。 - 16倍の空間圧縮と4倍の時間圧縮を備えた3D因果VAEに加え、長いシーケンスの計算を削減することを目的としたSelective and Sliding Tile Attention(SSTA)メカニズムを搭載。 - グリフ対応テキストエンコーディングによるバイリンガルプロンプト理解、およびvLLM互換エンドポイント(例ではQwen3モデルを参照)を介したオプションの自動プロンプト書き換え。 - 複数の高速化オプション:CFG蒸留モデル、ステップ蒸留モデル(480p I2V、8または12ステップ推奨)、スパースアテンション、SageAttention、フィーチャーキャッシング(deepcache、teacache、taylorcache)。FP8 GEMM推論もサポートされています。 - torchrunによる複数GPUでの分散推論。設定可能なオフロードとグループオフロードを備えています。 学習と統合 - 学習スクリプト(train.py)は、Muonオプティマイザーを使用した分散学習、FSDP、コンテキスト並列、勾配チェックポイントをサポートしています。 - 統合先には、Hugging Face Diffusers、ComfyUI(使用ガイドとコミュニティプラグイン付き)、LightX2V、Wan2GP、ComfyUI-MagCacheが含まれます。 要件 - Linux、Python 3.10以上、CUDA対応NVIDIA GPU、および使用する機能に応じたFlash Attention、Flex-Block-Attention、SageAttention、SGL-Kernelなどのアテンションライブラリのインストール。 モデル重みはHugging Faceで配布されており、480pおよび720pのT2V/I2Vバリアント、蒸留版、超解像モデルをカバーしています。一部の重み(特定のスパースおよび蒸留720pバリアントなど)は近日公開予定とされています。READMEには、プロンプトハンドブックとarXivレポートへのリンクもあります。