这个项目能做什么

CogVideoX 是由清影(QingYing)推出的开源视频生成模型。该仓库提供多种模型,包括 CogVideoX-2B、CogVideoX-5B、CogVideoX-5B-I2V 以及最新的 CogVideoX1.5-5B 系列。这些模型均支持三项核心任务:文生视频、图生视频以及视频续写。 CogVideoX1.5-5B 模型支持最高 1360x768 分辨率的 10 秒视频生成,而早期模型则生成 720x480 分辨率的 6 秒视频。I2V(图生视频)变体支持可变分辨率,最小维度为 768 像素。模型接受英文提示词,Token 限制为 224-226 个。 推理支持 Diffusers 和 SAT(SwissArmyTransformer)两种框架。Diffusers 版本支持内存优化技术,包括顺序 CPU 卸载、VAE 切片和 VAE 分块,使其能够在消费级显卡上运行。CogVideoX-2B 可在 GTX 1080 Ti 上运行,CogVideoX-5B 可在 RTX 3060 级别的显卡上运行。通过 TorchAO 实现的量化推理支持 INT8 精度,进一步降低了显存需求。仓库还免费提供基于 T4 实例的 Colab 笔记本,支持 T2V、I2V 和 V2V 任务。 微调方面支持通过 LoRA 训练以降低显存需求,CogKit 工具包为 CogView4 和 CogVideoX 系列提供了统一的微调与推理框架。社区开发的微调框架(cogvideox-factory)使得在单张 4090 GPU 上微调 CogVideoX-5B 成为可能。 该仓库还包含了 DDIM 反转支持、基于大语言模型的提示词优化指南,以及用于训练时将视频数据转换为文本描述的 CogVLM2-Caption 模型。原始的 CogVideo 模型(ICLR 2023)可作为分支获取,它是首个开源的基于 Transformer 的文生视频生成模型。CogVideoX-2B 采用 Apache 2.0 许可证发布。