À propos du projet

SparkVSR est un projet de recherche ECCV 2026 consacré à la super-résolution vidéo interactive. Au lieu de traiter la restauration comme un processus unidirectionnel de type boîte noire, il utilise des images clés haute résolution éparses comme signal contrôlable par l’utilisateur. Le modèle propage les informations visuelles de ces images clés à travers la vidéo tout en restant ancré dans le mouvement basse résolution d’origine. La méthode utilise un pipeline d’entraînement en deux étapes, de l’espace latent aux pixels, conditionné par des images clés et reposant sur CogVideoX1.5-5B-I2V. La première étape réalise une adaptation conditionnée par les images clés dans l’espace latent, et la seconde étape réalise un raffinement des détails dans l’espace pixels. Le dépôt fournit le code d’inférence et d’entraînement, les poids des étapes 1 et 2 sur Hugging Face, des scripts de préparation des jeux de données, des instructions pour les bancs d’essai et une implémentation ComfyUI. L’inférence propose trois modes de référence. Le mode API peut utiliser le point de terminaison fal-ai/nano-banana-pro/edit pour générer des images clés restaurées. Le mode PiSA-SR utilise le projet open-source distinct PiSA-SR comme générateur d’images clés. Le mode sans référence réalise une restauration aveugle sans images clés externes et est principalement présenté comme solution de repli ou référence de base. Les utilisateurs peuvent définir les indices des images clés, la force du guidage de référence et un facteur d’agrandissement 4x. La documentation précise que les indices de référence doivent être séparés de plus de quatre images et recommande d’utiliser uniquement la première image pour les très courts clips. Le README annonce la prise en charge d’une sélection flexible des images clés, incluant la sélection manuelle, l’extraction d’images I du codec et l’échantillonnage aléatoire. Il décrit également un mécanisme de guidage qui équilibre l’adhésion aux images clés fournies et la restauration aveugle lorsque les références sont manquantes ou imparfaites. Les auteurs démontrent l’approche au-delà de la super-résolution standard sur des tâches telles que la restauration de films anciens et le transfert de style vidéo. La configuration nécessite Python 3.10 ou une version plus récente, PyTorch 2.5 ou une version plus récente, Diffusers et les paquets listés dans requirements.txt. L’entraînement est documenté pour quatre GPU A100. Les conseils relatifs aux données d’entraînement couvrent HQ-VSR et DIV2K-HR, tandis que les conseils d’évaluation couvrent UDM10, SPMCS, YouHQ40, RealVSR et MovieLQ. Le script d’évaluation unifié peut utiliser des installations externes de DOVER et FastVQA/FasterVQA, les résultats étant écrits en JSON. Seul le point de contrôle de l’étape 2 est destiné à l’inférence finale.