À propos du projet
Wan2.2 est une suite de modèles de génération vidéo open source développée par Wan-AI. Elle introduit une architecture Mixture-of-Experts (MoE) dans les modèles de diffusion vidéo, en séparant le processus de débruitage à travers les pas temporels à l'aide de modèles experts spécialisés, afin d'augmenter la capacité tout en maintenant le coût computationnel. La suite prend en charge plusieurs tâches de génération :
- Text-to-Video (T2V-A14B) : génère des vidéos à partir de descriptions textuelles en résolutions 480P et 720P.
- Image-to-Video (I2V-A14B) : génère des vidéos à partir d'une image de référence et d'une description textuelle.
- Text-Image-to-Video (TI2V-5B) : un modèle de 5 milliards de paramètres utilisant un Wan2.2-VAE avec un taux de compression de 16x16x4, prenant en charge le 720P à 24 images par seconde. Ce modèle peut fonctionner sur des GPU grand public disposant d'au moins 24 Go de VRAM (par exemple, RTX 4090).
- Speech-to-Video (S2V-14B) : un modèle de génération vidéo cinématographique piloté par l'audio, acceptant une entrée audio, une image de référence et une description textuelle optionnelle. Il prend en charge la génération guidée par la pose via un paramètre de vidéo de pose. Il peut intégrer CosyVoice pour la synthèse texte-parole.
- Character Animation and Replacement (Animate-14B) : prend une vidéo et une image de personnage en entrée, et génère des vidéos en mode animation (le personnage imite le mouvement de la vidéo d'entrée) ou en mode remplacement (remplace le personnage dans la vidéo d'entrée).
Le dépôt fournit des scripts d'inférence mono-GPU et multi-GPU utilisant PyTorch FSDP et DeepSpeed Ulysses pour l'accélération. L'extension des prompts est prise en charge via l'API Dashscope ou les modèles Qwen locaux pour enrichir les détails des vidéos générées. Les poids des modèles sont disponibles sur Hugging Face et ModelScope.
Wan2.2 a été intégré dans ComfyUI et Hugging Face Diffusers. La communauté a développé des projets connexes, notamment LightX2V (framework d'inférence léger), FastVideo (modèles distillés avec attention sparse), Cache-dit (accélération par cache), DiffSynth-Studio (offload pour faible VRAM, quantification FP8, entraînement LoRA), et Kijai's ComfyUI WanVideoWrapper.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.