Об этом проекте

CogVideoX — это открытая модель генерации видео, разработанная компанией QingYing. В репозитории представлено несколько моделей, включая CogVideoX-2B, CogVideoX-5B, CogVideoX-5B-I2V и новейшую серию CogVideoX1.5-5B. Эти модели поддерживают три основные задачи: генерация видео по тексту, генерация видео по изображению и продолжение существующего видео. Модели серии CogVideoX1.5-5B поддерживают генерацию 10-секундных видео с разрешением до 1360x768, в то время как более ранние модели генерируют 6-секундные видео с разрешением 720x480. Вариант I2V (генерация видео по изображению) поддерживает переменные разрешения с минимальным размером стороны 768 пикселей. Модели принимают запросы на английском языке с ограничением по количеству токенов 224–226. Для запуска моделей поддерживаются два фреймворка: Diffusers и SAT (SwissArmyTransformer). Версия для Diffusers поддерживает оптимизации использования памяти, включая последовательную выгрузку на CPU, нарезку VAE и тайлинг VAE, что позволяет запускать модели на потребительских GPU. CogVideoX-2B может работать на видеокартах класса GTX 1080 Ti, а CogVideoX-5B — на видеокартах класса RTX 3060. Квантованный запуск через TorchAO поддерживает точность INT8, что дополнительно снижает требования к объему памяти. В репозитории доступны блокноты Colab для задач T2V, I2V и V2V на бесплатных экземплярах T4. Поддерживается дообучение моделей с помощью обучения LoRA с сниженными требованиями к объему памяти GPU, а набор инструментов CogKit предоставляет унифицированный фреймворк для дообучения и запуска моделей серий CogView4 и CogVideoX. Разработанный сообществом фреймворк для дообучения (cogvideox-factory) позволяет дообучать модель CogVideoX-5B на одной видеокарте 4090. В репозитории также доступна поддержка DDIM-инверсии, руководство по оптимизации запросов с использованием больших языковых моделей, а также модель CogVLM2-Caption, которая используется для преобразования видеоданных в текстовые описания во время обучения. Исходная модель CogVideo (ICLR 2023) доступна в отдельной ветке как первая открытая модель для генерации видео по тексту на основе Transformer. Модель CogVideoX-2B распространяется под лицензией Apache 2.0.