Об этом проекте
SparkVSR — это исследовательский проект ECCV 2026 для интерактивного видео-суперразрешения. Вместо того чтобы рассматривать восстановление как односторонний процесс «черного ящика», он использует разреженные высококачественные ключевые кадры как управляемый пользователем сигнал. Модель распространяет визуальную информацию из этих ключевых кадров по всему видео, оставаясь привязанной к исходному движению с низким разрешением.
Метод использует двухэтапный конвейер обучения «латентное-пространство-в-пиксели», основанный на CogVideoX1.5-5B-I2V. Этап 1 выполняет адаптацию в латентном пространстве с условием на ключевые кадры, а Этап 2 — уточнение деталей в пиксельном пространстве. Репозиторий предоставляет код вывода и обучения, веса Этапа 1 и Этапа 2 на Hugging Face, скрипты подготовки наборов данных, инструкции по бенчмаркам и реализацию для ComfyUI.
Вывод предлагает три режима ссылок. Режим API может использовать конечную точку fal-ai/nano-banana-pro/edit для генерации восстановленных ключевых кадров. Режим PiSA-SR использует отдельный проект с открытым исходным кодом PiSA-SR в качестве генератора ключевых кадров. Режим без ссылок выполняет слепое восстановление без внешних ключевых кадров и представлен в основном как запасной вариант или базовый уровень. Пользователи могут задавать индексы ключевых кадров, силу управления ссылками и коэффициент увеличения 4x. В документации отмечается, что индексы ссылок должны отстоять друг от друга более чем на четыре кадра, и рекомендуется использовать только первый кадр для очень коротких клипов.
В README сообщается о поддержке гибкого выбора ключевых кадров, включая ручной выбор, извлечение I-кадров кодеком и случайную выборку. Также описывается механизм управления, который балансирует между следованием предоставленным ключевым кадрам и слепым восстановлением, когда ссылки отсутствуют или несовершенны. Авторы демонстрируют подход за пределами стандартного суперразрешения на таких задачах, как восстановление старых фильмов и перенос стиля видео.
Настройка требует Python 3.10 или новее, PyTorch 2.5 или новее, Diffusers и пакетов, перечисленных в requirements.txt. Обучение документировано для четырех GPU A100. Руководство по данным для обучения охватывает HQ-VSR и DIV2K-HR, а руководство по оценке — UDM10, SPMCS, YouHQ40, RealVSR и MovieLQ. Унифицированный скрипт оценки может использовать внешние установки DOVER и FastVQA/FasterVQA, результаты записываются в JSON. Только контрольная точка Этапа 2 предназначена для окончательного вывода.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.