À propos du projet

Wan2.1 est une suite de modèles de génération vidéo à grande échelle, ouverte et avancée. Elle prend en charge plusieurs tâches, notamment la génération de vidéos à partir de texte (Text-to-Video, T2V), la génération de vidéos à partir d'images (Image-to-Video, I2V), la génération de vidéos à partir de la première et de la dernière image (First-Last-Frame-to-Video, FLF2V), l'édition de vidéos, la génération d'images à partir de texte (Text-to-Image) et la génération d'audio à partir de vidéo (Video-to-Audio). Le dépôt fournit des points de contrôle de modèles de 1,3 milliard et 14 milliards de paramètres, prenant en charge les résolutions 480P et 720P. Les capacités clés incluent : - Prise en charge des GPU grand public : le modèle T2V-1.3B nécessite 8,19 Go de VRAM, permettant la génération de vidéos sur des GPU standards. - Génération de texte visuel : capable de générer du texte en chinois et en anglais au sein des vidéos. - Wan-VAE : un VAE vidéo pour l'encodage et le décodage de vidéos 1080P de toute durée tout en préservant l'information temporelle. - VACE : un modèle tout-en-un pour la création et l'édition de vidéos. Le dépôt propose des scripts d'inférence sur un seul GPU et sur plusieurs GPU utilisant FSDP et xDiT USP (stratégies Ulysses et Ring). Il prend en charge l'extension des prompts via l'API Dashscope ou les modèles locaux Qwen. L'intégration avec Diffusers, ComfyUI et les démonstrations Gradio est fournie. Les poids des modèles sont disponibles sur Hugging Face et ModelScope.