このプロジェクトについて
SparkVSRは、インタラクティブ動画超解像のためのECCV 2026研究プロジェクトです。復元を一方通行のブラックボックスプロセスとして扱うのではなく、疎な高解像度キーフレームをユーザーが制御可能な信号として使用します。モデルは、元の低解像度の動きに根ざしたまま、それらのキーフレームから視覚情報を動画全体に伝播します。
この手法は、CogVideoX1.5-5B-I2V上に構築された、キーフレーム条件付きの潜在空間からピクセル空間への2段階学習パイプラインを使用します。第1段階では潜在空間でキーフレーム条件付き適応を行い、第2段階ではピクセル空間で詳細を精緻化します。リポジトリには、推論および学習コード、Hugging Face上の第1段階・第2段階の重み、データセット準備スクリプト、ベンチマーク手順、ComfyUI実装が含まれています。
推論には3つの参照モードがあります。APIモードでは、fal-ai/nano-banana-pro/editエンドポイントを使用して復元キーフレームを生成できます。PiSA-SRモードは、別のオープンソースプロジェクトであるPiSA-SRをキーフレーム生成器として使用します。参照なしモードは、外部キーフレームなしでブラインド復元を行い、主にフォールバックまたはベースラインとして提示されています。ユーザーはキーフレームインデックス、参照ガイダンス強度、4倍のアップスケール倍率を設定できます。ドキュメントでは、参照インデックス同士は4フレーム以上離す必要があり、非常に短いクリップでは最初のフレームのみを使用することが推奨されています。
READMEには、手動選択、コーデックのIフレーム抽出、ランダムサンプリングを含む柔軟なキーフレーム選択のサポートが記載されています。また、参照が欠落しているか不完全な場合に、提供されたキーフレームへの追従とブラインド復元のバランスを取るガイダンス機構についても説明されています。著者らは、標準的な超解像に加えて、古いフィルムの復元や動画スタイル変換などのタスクでもこの手法を実証しています。
セットアップには、Python 3.10以降、PyTorch 2.5以降、Diffusers、およびrequirements.txtに記載されたパッケージが必要です。学習は4基のA100 GPUを想定して文書化されています。学習データのガイダンスはHQ-VSRとDIV2K-HRをカバーし、評価ガイダンスはUDM10、SPMCS、YouHQ40、RealVSR、MovieLQをカバーしています。統合評価スクリプトは、外部にインストールされたDOVERおよびFastVQA/FasterVQAを使用でき、結果はJSONに書き出されます。最終推論に使用することを意図されているのは、第2段階のチェックポイントのみです。
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.