À propos du projet

HunyuanVideo-1.5 est un modèle open-source de génération vidéo publié par Tencent Hunyuan. Il s'agit d'un modèle léger de transformateur à diffusion (DiT) avec 8,3 milliards de paramètres, conçu pour fonctionner sur des GPU NVIDIA grand public avec aussi peu que 14 Go de VRAM lorsque le déchargement du modèle est activé. Le dépôt fournit le code d'inférence, les poids du modèle, le code d'entraînement et des scripts de réglage fin LoRA. Capacités - Génération texte-vers-vidéo (T2V) et image-vers-vidéo (I2V) en 480p et 720p, avec un réseau de super-résolution en quelques étapes qui augmente les sorties en 1080p. - Un VAE causal 3D avec compression spatiale 16x et temporelle 4x, plus un mécanisme d'attention par tuiles glissantes et sélectives (SSTA) destiné à réduire le calcul pour les longues séquences. - Compréhension bilingue des invites via un encodage de texte sensible aux glyphes, et réécriture automatique facultative des invites via un point de terminaison compatible vLLM (les exemples référencent les modèles Qwen3). - Plusieurs options d'accélération : modèles distillés CFG, modèles distillés par étapes (I2V 480p, 8 ou 12 étapes recommandées), attention éparse, SageAttention et mise en cache des caractéristiques (deepcache, teacache, taylorcache). L'inférence GEMM FP8 est également prise en charge. - Inférence distribuée via torchrun sur plusieurs GPU, avec déchargement configurable et déchargement de groupe. Entraînement et intégration - Le script d'entraînement (train.py) prend en charge l'entraînement distribué, FSDP, le parallélisme contextuel et le contrôle de gradient, en utilisant l'optimiseur Muon. - Les intégrations listées incluent Hugging Face Diffusers, ComfyUI (avec un guide d'utilisation et un plugin communautaire), LightX2V, Wan2GP et ComfyUI-MagCache. Exigences - Linux, Python 3.10+, GPU NVIDIA compatible CUDA, et installation de bibliothèques d'attention telles que Flash Attention, Flex-Block-Attention, SageAttention et SGL-Kernel selon les fonctionnalités utilisées. Les poids du modèle sont distribués sur Hugging Face, couvrant les variantes T2V/I2V 480p et 720p, les versions distillées et les modèles de super-résolution. Certains poids (par exemple, certaines variantes 720p éparses et distillées) sont marqués comme bientôt disponibles. Le README fournit également un manuel d'invites et un rapport arXiv.