このプロジェクトについて

LTX-VideoはLightricksが開発したオープンソースのDiTベース動画生成モデルで、単一のモデルに動画生成の中核機能を統合しています。同期音声と動画の生成、高忠実度な出力、複数のパフォーマンスモードを備え、1回の推論で最大4K解像度・50FPSの動画と同期音声を生成可能です。 主な機能は以下の通りです。 ・テキストから動画、画像から動画の生成 ・動画の延長(前方・後方) ・マルチキーフレーム条件付けとキーフレームベースのアニメーション ・動画から動画への変換 ・同期音声生成(LTX-2で対応) リポジトリには13Bパラメータ版、2Bパラメータ版のほか、推論を高速化した蒸留モデル、VRAM使用量を削減したFP8量子化版など、複数のモデルバリアントが用意されています。蒸留モデルは迅速な反復作業をサポートし、適切なハードウェア環境下では数秒でHD動画を生成可能です。2B蒸留モデルのLoRA variantではVRAM使用量はわずか1GBです。 LTX-VideoはComfyUI、Diffusersと統合可能で、PythonライブラリAPIも提供されています。深度、ポーズ、Cannyエッジ条件付けのコントロールモデルに対応し、LoRAによるスタイルカスタマイズのファインチューニングも可能です。本モデルは商用利用可能なOpenRAIL-Mライセンスの下で公開されています。 コミュニティの貢献として、RF-Inversion・RF-Edit・FlowEditなどの高度な編集ワークフローを提供するComfyUI-LTXTricks、NVIDIA ADA GPU向け8bit最適化推論を実現するLTX-VideoQ8、トレーニング不要の推論高速化を実現するTeaCacheなどが存在します。後継モデルのLTX-2では、同期音声動画生成、より長いクリップのサポート、クリエイティブコントロール機能の強化が追加されています。