À propos du projet
CogVideoX est un modèle de génération vidéo open source originaire de QingYing. Le dépôt propose plusieurs modèles, dont CogVideoX-2B, CogVideoX-5B, CogVideoX-5B-I2V et la dernière série CogVideoX1.5-5B. Ces modèles prennent en charge trois tâches principales : la génération texte-vers-vidéo, la génération image-vers-vidéo et la continuation de vidéo.
Les modèles CogVideoX1.5-5B prennent en charge des vidéos de 10 secondes à des résolutions allant jusqu'à 1360x768, tandis que les modèles antérieurs génèrent des vidéos de 6 secondes à une résolution de 720x480. La variante I2V (image-vers-vidéo) prend en charge des résolutions variables dont la dimension minimale est de 768 pixels. Les modèles acceptent des prompts en anglais avec des limites de tokens comprises entre 224 et 226.
L'inférence est prise en charge via deux frameworks : Diffusers et SAT (SwissArmyTransformer). La version Diffusers prend en charge des optimisations de mémoire incluant le déchargement séquentiel sur CPU, le découpage de VAE et le tuilage de VAE, permettant l'inférence sur des GPUs grand public. CogVideoX-2B peut fonctionner sur des GPU GTX 1080 Ti, tandis que CogVideoX-5B fonctionne sur des GPU de la classe RTX 3060. L'inférence quantifiée via TorchAO prend en charge la précision INT8, réduisant encore les besoins en mémoire. Le dépôt propose des notebooks Colab pour les tâches T2V, I2V et V2V sur des instances T4 gratuites.
Le fine-tuning est pris en charge via l'entraînement LoRA avec des besoins en mémoire GPU réduits, et la boîte à outils CogKit propose un framework unifié pour le fine-tuning et l'inférence sur les séries CogView4 et CogVideoX. Un framework de fine-tuning développé par la communauté (cogvideox-factory) permet d'effectuer le fine-tuning de CogVideoX-5B sur un seul GPU 4090.
Le dépôt inclut également la prise en charge de l'inversion DDIM, un guide d'optimisation de prompts utilisant des modèles de langage larges, et le modèle CogVLM2-Caption utilisé pour convertir des données vidéo en descriptions textuelles pendant l'entraînement. Le modèle CogVideo original (ICLR 2023) est disponible sur une branche séparée en tant que premier modèle de génération texte-vers-vidéo open source basé sur Transformer. CogVideoX-2B est publié sous licence Apache 2.0.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.