このプロジェクトについて

FramePackは、「Frame Context Packing and Drift Prevention in Next-Frame-Prediction Video Diffusion Models」という論文の公式実装かつデスクトップソフトウェアです。動画を段階的に生成する次のフレーム(次のフレームセクション)予測ニューラルネットワーク構造です。 主要な技術的アプローチ: FramePackは入力コンテキストを一定長に圧縮することで、生成負荷が動画の長さに依存しないようにします。これにより、13Bモデルを使って非常に多くのフレームをラップトップGPUでも処理できます。作者たちはこれを「動画拡散だが、画像拡散のように感じる」と表現しています。また、画像拡散訓練と同様の大きなバッチサイズで訓練することも可能です。 ハードウェア要件: Nvidia RTX 30XX、40XX、50XXシリーズのGPU(fp16およびbf16対応、GTX 10XX/20XXは未検証)、LinuxまたはWindows、少なくとも6GBのGPUメモリが必要です。13Bモデルで30fps、1分間(1800フレーム)の動画を生成する場合、最小6GBのGPUメモリがあれば可能です。ソフトウェアはGradioベースのGUIを提供し、左側で画像をアップロードしてプロンプトを入力し、右側で生成された動画と潜在表現のプレビューを確認できます。動画はセクションごとに生成され、その過程全体で視覚的なフィードバックが得られます。 インストール方法としては、Windows向けのワンクリックパッケージ(CUDA 12.6 + PyTorch 2.6)と、Python 3.10でのpipによるLinuxインストールが用意されています。PyTorch attention、xformers、flash-attn、sage-attentionカーネルをサポートします。TeaCacheによる高速化も利用できますが、非可逆であるため結果に影響を与える可能性があることに注意が必要です。リポジトリには安全性確認用の例とプロンプトガイドラインが含まれており、簡潔で動きに焦点を当てたプロンプトが推奨されています。 リポジトリは、これが唯一の公式FramePackサイトであり、framepack.co、framepack.aiなど他多数のドメインは偽物であり使用すべきではないことを明確に警告しています。