Sobre el proyecto
CogVideoX es un modelo de generación de vídeo de código abierto originario de QingYing. El repositorio proporciona múltiples modelos, entre los que se incluyen CogVideoX-2B, CogVideoX-5B, CogVideoX-5B-I2V y la última serie CogVideoX1.5-5B. Estos modelos admiten tres tareas principales: generación de vídeo a partir de texto, generación de vídeo a partir de imagen y continuación de vídeo.
Los modelos CogVideoX1.5-5B admiten vídeos de 10 segundos con resoluciones de hasta 1360x768, mientras que los modelos anteriores generan vídeos de 6 segundos con resolución de 720x480. La variante I2V (imagen a vídeo) admite resoluciones variables con una dimensión mínima de 768 píxeles. Los modelos aceptan indicaciones en inglés con límites de tokens de entre 224 y 226 tokens.
La inferencia es compatible con dos marcos de trabajo: Diffusers y SAT (SwissArmyTransformer). La versión de Diffusers admite optimizaciones de memoria, como la descarga secuencial en CPU, el troceado de VAE y el mosaico de VAE, lo que permite realizar inferencias en GPUs de consumo. El modelo CogVideoX-2B se puede ejecutar en una GTX 1080 Ti, mientras que el CogVideoX-5B se ejecuta en GPUs de la clase RTX 3060. La inferencia cuantizada a través de TorchAO admite precisión INT8, lo que reduce aún más los requisitos de memoria. El repositorio proporciona cuadernos de Colab para las tareas T2V, I2V y V2V en instancias T4 gratuitas.
Se admite el ajuste fino mediante entrenamiento LoRA con requisitos reducidos de memoria de GPU, y el kit de herramientas CogKit proporciona un marco unificado para el ajuste fino y la inferencia en las series CogView4 y CogVideoX. Un marco de ajuste fino desarrollado por la comunidad (cogvideox-factory) permite realizar el ajuste fino del CogVideoX-5B en una sola GPU 4090.
El repositorio también incluye compatibilidad con inversión DDIM, una guía de optimización de indicaciones que utiliza modelos de lenguaje grande y el modelo CogVLM2-Caption que se usa para convertir datos de vídeo en descripciones textuales durante el entrenamiento. El modelo CogVideo original (ICLR 2023) está disponible en una rama separada como el primer modelo de generación de vídeo de texto a vídeo basado en Transformer de código abierto. El modelo CogVideoX-2B se publica bajo la licencia Apache 2.0.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.