这个项目能做什么
SparkVSR 是 ECCV 2026 的一个交互式视频超分辨率研究项目。它没有将恢复视为单向的黑盒过程,而是使用稀疏的高分辨率关键帧作为用户可控的信号。该模型从这些关键帧向视频传播视觉信息,同时保持基于原始低分辨率运动。
该方法使用基于关键帧条件、潜在到像素的两阶段训练流程,构建在 CogVideoX1.5-5B-I2V 之上。第一阶段执行潜在空间的关键帧条件适应,第二阶段执行像素空间的细节细化。该仓库提供推理和训练代码、Hugging Face 上的第一阶段和第二阶段权重、数据集准备脚本、基准测试说明以及 ComfyUI 实现。
推理提供三种参考模式。API 模式可以使用 fal-ai/nano-banana-pro/edit 端点生成恢复的关键帧。PiSA-SR 模式使用独立的开源项目 PiSA-SR 作为关键帧生成器。无参考模式在没有外部关键帧的情况下执行盲恢复,主要作为回退或基线呈现。用户可以设置关键帧索引、参考引导强度和 4 倍放大因子。文档指出,参考索引必须相隔超过四帧,并建议对于非常短的片段仅使用第一帧。
README 报告支持灵活的关键帧选择,包括手动选择、编解码器 I 帧提取和随机采样。它还描述了一种引导机制,该机制在参考缺失或不完美时平衡对提供关键帧的遵循与盲恢复。作者在标准超分辨率之外的任务上展示了该方法,例如旧电影修复和视频风格迁移。
设置需要 Python 3.10 或更新版本、PyTorch 2.5 或更新版本、Diffusers 以及 requirements.txt 中列出的包。训练文档针对四块 A100 GPU。训练数据指南涵盖 HQ-VSR 和 DIV2K-HR,而评估指南涵盖 UDM10、SPMCS、YouHQ40、RealVSR 和 MovieLQ。统一的评估脚本可以使用外部的 DOVER 和 FastVQA/FasterVQA 安装,结果写入 JSON。只有第二阶段检查点用于最终推理。
评论
0 评分人数达到10人后显示
登录后参与讨论。