Sobre el proyecto

Wan2.2 es una suite de modelos generativos de video de código abierto desarrollada por Wan-AI. Introduce una arquitectura de Mezcla de Expertos (MoE, por sus siglas en inglés) en modelos de difusión de video, separando el proceso de eliminación de ruido entre timesteps mediante modelos expertos especializados para aumentar la capacidad mientras se mantiene el coste computacional. La suite admite múltiples tareas de generación: - Texto a Video (T2V-A14B): Genera video a partir de prompts de texto en resoluciones de 480P y 720P. - Imagen a Video (I2V-A14B): Genera video a partir de una imagen de referencia y un prompt de texto. - Texto e Imagen a Video (TI2V-5B): Un modelo de 5B parámetros que utiliza un Wan2.2-VAE con una relación de compresión de 16x16x4, compatible con 720P a 24fps. Este modelo puede ejecutarse en GPUs para consumo con al menos 24GB de VRAM (por ejemplo, RTX 4090). - Voz a Video (S2V-14B): Un modelo de generación cinematográfica impulsado por audio que acepta entrada de audio, una imagen de referencia y un prompt de texto opcional. Admite generación guiada por postura mediante un parámetro de video de pose. Puede integrarse con CosyVoice para síntesis de texto a voz. - Animación y Reemplazo de Personajes (Animate-14B): Toma un video y una imagen de personaje como entrada, generando videos ya sea en modo animación (el personaje imita el movimiento del video de entrada) o en modo reemplazo (reemplaza el personaje en el video de entrada). El repositorio proporciona scripts de inferencia para GPU única y multi-GPU utilizando PyTorch FSDP y DeepSpeed Ulysses para aceleración. El extensión de prompts está disponible mediante la API de Dashscope o modelos Qwen locales para enriquecer los detalles del video generado. Los pesos del modelo están disponibles en Hugging Face y ModelScope. Wan2.2 ha sido integrado en ComfyUI y Hugging Face Diffusers. La comunidad ha construido proyectos relacionados, incluyendo LightX2V (framework de inferencia ligera), FastVideo (modelos destilados con atención dispersa), Cache-dit (aceleración por caché), DiffSynth-Studio (descarga con baja VRAM, cuantización FP8, entrenamiento LoRA) y WanVideoWrapper de Kijai para ComfyUI.