À propos du projet
HunyuanVideo est un modèle fondamental open-source pour la vidéo développé par Tencent, conçu pour la génération vidéo à grande échelle. Le dépôt fournit les définitions du modèle PyTorch, les poids pré-entraînés et le code d'inférence/sampling.
Les caractéristiques techniques clés incluent :
- Architecture générique unifiée image/vidéo : Utilise une conception hybride de Transformer « Dual-stream to Single-stream » avec un mécanisme d'attention complète, traitant indépendamment les tokens vidéo et texte avant de les fusionner pour l'intégration d'informations multimodales.
- Encodeur textuel MLLM : Utilise un modèle de langage large multimodal (MLLM) pré-entraîné avec une structure Decoder-Only comme encodeur textuel, offrant un meilleur alignement image-texte et un raisonnement complexe par rapport à CLIP ou T5-XXL.
- VAE 3D : Recourt à un VAE 3D causal avec CausalConv3D pour compresser les vidéos en espace pixel vers un espace latent compact avec des ratios de compression de 4x pour la longueur vidéo, 8x pour l'espace et 16x pour les canaux.
- Réécriture de prompt : Inclut un modèle de réécriture de prompt finement ajusté (basé sur Hunyuan-Large) avec des modes Normal et Master pour adapter les prompts utilisateur afin d'améliorer les résultats de génération vidéo.
Le modèle compte plus de 13 milliards de paramètres. Le dépôt prend en charge l'inférence sur un seul GPU, l'inférence parallèle multi-GPU via xDiT, et des poids quantifiés FP8 pour réduire l'utilisation de la mémoire GPU. Il nécessite un minimum de 45 Go de mémoire GPU (pour 544x960x129f) ou 60 Go (pour 720x1280x129f), avec 80 Go recommandés.
Le projet a donné naissance à plusieurs dérivés dont HunyuanVideo-I2V (image-to-video), HunyuanVideo-Avatar (animation pilotée par audio) et HunyuanCustom (génération vidéo personnalisée). Il s'intègre à Diffusers et ComfyUI, avec des contributions communautaires proposant des versions quantifiées, des outils d'accélération et diverses optimisations.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.