Sobre el proyecto

SparkVSR es un proyecto de investigación de ECCV 2026 para la superresolución interactiva de video. En lugar de tratar la restauración como un proceso unidireccional de caja negra, utiliza fotogramas clave dispersos de alta resolución como una señal controlable por el usuario. El modelo propaga la información visual de esos fotogramas clave a través del video, manteniéndose basado en el movimiento original de baja resolución. El método emplea una canalización de entrenamiento de dos etapas, de espacio latente a píxeles, condicionada por fotogramas clave y construida sobre CogVideoX1.5-5B-I2V. La etapa 1 realiza una adaptación en espacio latente condicionada por fotogramas clave, y la etapa 2 realiza el refinamiento de detalles en espacio de píxeles. El repositorio proporciona código de inferencia y entrenamiento, pesos de las etapas 1 y 2 en Hugging Face, scripts de preparación de conjuntos de datos, instrucciones de referencia y una implementación para ComfyUI. La inferencia ofrece tres modos de referencia. El modo API puede utilizar el endpoint fal-ai/nano-banana-pro/edit para generar fotogramas clave restaurados. El modo PiSA-SR utiliza el proyecto independiente de código abierto PiSA-SR como generador de fotogramas clave. El modo sin referencia realiza restauración ciega sin fotogramas clave externos y se presenta principalmente como alternativa o línea base. Los usuarios pueden configurar los índices de los fotogramas clave, la fuerza de guía de referencia y un factor de escalado 4x. La documentación indica que los índices de referencia deben estar separados por más de cuatro fotogramas y recomienda usar únicamente el primer fotograma en clips muy cortos. El README informa soporte para selección flexible de fotogramas clave, incluidos la selección manual, la extracción de fotogramas I del códec y el muestreo aleatorio. También describe un mecanismo de guía que equilibra la adherencia a los fotogramas clave proporcionados con la restauración ciega cuando las referencias faltan o son imperfectas. Los autores demuestran el enfoque más allá de la superresolución estándar en tareas como la restauración de películas antiguas y la transferencia de estilo de video. La configuración requiere Python 3.10 o superior, PyTorch 2.5 o superior, Diffusers y los paquetes enumerados en requirements.txt. El entrenamiento está documentado para cuatro GPU A100. La guía de datos de entrenamiento cubre HQ-VSR y DIV2K-HR, mientras que la guía de evaluación cubre UDM10, SPMCS, YouHQ40, RealVSR y MovieLQ. El script de evaluación unificado puede utilizar instalaciones externas de DOVER y FastVQA/FasterVQA, y los resultados se escriben en JSON. Solo el checkpoint de la etapa 2 está destinado a la inferencia final.