Sobre el proyecto

ComfyUI-SeedVR2_VideoUpscaler es el empaquetado oficial de ComfyUI del modelo SeedVR2 de ByteDance para el escalado de videos e imágenes mediante difusión. Su objetivo es preservar la coherencia temporal entre fotogramas mientras mejora los detalles, y admite contenido RGB y RGBA, incluyendo imágenes transparentes. En ComfyUI, el proyecto utiliza una configuración de nodos modulares con nodos separados para el modelo DiT, el modelo VAE, la configuración de torch.compile y el escalador principal. Sigue el diseño de nodos sin estado de ComfyUI V3 y puede compartir modelos cargados entre múltiples instancias del escalador a través de un caché global. Los modelos se pueden descargar automáticamente desde Hugging Face en el primer uso. Las variantes de modelo compatibles incluyen modelos de 3B y 7B parámetros en formatos FP16, FP8 y GGUF, con cuantización GGUF de 4 y 8 bits destinada a sistemas con menor VRAM. Los usuarios pueden controlar el procesamiento por lotes, la superposición temporal, los fotogramas antepuestos, la resolución máxima y la semilla determinista. El escalador admite salidas con resoluciones divisibles por 2 y utiliza relleno en lugar de recorte restrictivo. Las características de memoria y ejecución incluyen intercambio de bloques del transformador, codificación y decodificación de VAE en mosaicos, descarga de modelos y tensores, almacenamiento en caché de modelos, decodificación de VAE en flujo continuo y procesamiento fragmentado para videos largos. Los backends de atención incluyen PyTorch SDPA, Flash Attention 2/3, SageAttention 2/3 y atención cuDNN, con comportamiento de respaldo cuando un backend opcional no está disponible. La integración de torch.compile es opcional. El repositorio también se puede usar independientemente de ComfyUI como una CLI independiente. La CLI admite imágenes individuales, videos individuales y procesamiento por lotes de directorios, con detección automática de salida MP4/PNG, distribución de carga de trabajo en múltiples GPU, combinación de superposición temporal, almacenamiento en caché de modelos y fragmentos de transmisión limitados por memoria. Un backend de video FFmpeg proporciona salida x265 de 10 bits como alternativa a la salida OpenCV de 8 bits. El trabajo de compatibilidad de plataformas cubre NVIDIA CUDA, AMD ROCm y Apple Silicon MPS, incluido el manejo de respaldo de bfloat16 para GPU antiguas. Las características de procesamiento de color incluyen transferencia de color LAB, coincidencia de saturación HSV, procesamiento basado en wavelets y enfoques híbridos. El proyecto se publica bajo la licencia Apache 2.0.