Sobre o projeto
SparkVSR é um projeto de pesquisa do ECCV 2026 para super-resolução interativa de vídeo. Em vez de tratar a restauração como um processo de caixa preta unidirecional, ele usa quadros-chave esparsos de alta resolução como um sinal controlável pelo usuário. O modelo propaga informações visuais desses quadros-chave através do vídeo, mantendo-se fundamentado no movimento original de baixa resolução.
O método utiliza um pipeline de treinamento em dois estágios, condicionado a quadros-chave, de latente para pixel, construído sobre o CogVideoX1.5-5B-I2V. O Estágio 1 realiza a adaptação condicionada a quadros-chave no espaço latente, e o Estágio 2 realiza o refinamento de detalhes no espaço de pixel. O repositório fornece código de inferência e treinamento, pesos do Estágio 1 e Estágio 2 no Hugging Face, scripts de preparação de conjuntos de dados, instruções de benchmark e uma implementação para ComfyUI.
A inferência oferece três modos de referência. O modo API pode usar o endpoint fal-ai/nano-banana-pro/edit para gerar quadros-chave restaurados. O modo PiSA-SR usa o projeto open-source separado PiSA-SR como gerador de quadros-chave. O modo sem referência realiza restauração cega sem quadros-chave externos e é apresentado principalmente como uma alternativa ou linha de base. Os usuários podem definir índices de quadros-chave, força de orientação da referência e um fator de upscale de 4x. A documentação observa que os índices de referência devem estar separados por mais de quatro quadros e recomenda usar apenas o primeiro quadro para clipes muito curtos.
O README relata suporte para seleção flexível de quadros-chave, incluindo seleção manual, extração de quadros I do codec e amostragem aleatória. Ele também descreve um mecanismo de orientação que equilibra a adesão aos quadros-chave fornecidos com a restauração cega quando as referências estão ausentes ou são imperfeitas. Os autores demonstram a abordagem além da super-resolução padrão em tarefas como restauração de filmes antigos e transferência de estilo de vídeo.
A configuração requer Python 3.10 ou superior, PyTorch 2.5 ou superior, Diffusers e os pacotes listados em requirements.txt. O treinamento é documentado para quatro GPUs A100. A orientação sobre dados de treinamento cobre HQ-VSR e DIV2K-HR, enquanto a orientação de avaliação cobre UDM10, SPMCS, YouHQ40, RealVSR e MovieLQ. O script de avaliação unificado pode usar instalações externas de DOVER e FastVQA/FasterVQA, com resultados gravados em JSON. Apenas o checkpoint do Estágio 2 é destinado à inferência final.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.