这个项目能做什么

HunyuanVideo-1.5 是腾讯混元发布的开源视频生成模型。它是一个轻量级扩散变换器(DiT)模型,拥有83亿参数,旨在消费级NVIDIA GPU上运行,启用模型卸载时仅需约14 GB显存。该仓库提供推理代码、模型权重、训练代码和LoRA微调脚本。 功能 - 支持480p和720p的文本到视频(T2V)和图像到视频(I2V)生成,并配备少步超分辨率网络,可将输出提升至1080p。 - 采用3D因果VAE,具有16倍空间和4倍时间压缩,以及选择性滑动瓦片注意力(SSTA)机制,旨在减少长序列的计算量。 - 通过字形感知文本编码实现双语提示理解,并可通过兼容vLLM的端点进行可选的自动提示重写(示例引用Qwen3模型)。 - 多种加速选项:CFG蒸馏模型、步数蒸馏模型(480p I2V,推荐8或12步)、稀疏注意力、SageAttention和特征缓存(deepcache、teacache、taylorcache)。还支持FP8 GEMM推理。 - 通过torchrun在多个GPU上进行分布式推理,支持可配置的卸载和组卸载。 训练与集成 - 训练脚本(train.py)支持分布式训练、FSDP、上下文并行和梯度检查点,使用Muon优化器。 - 列出的集成包括Hugging Face Diffusers、ComfyUI(附使用指南和社区插件)、LightX2V、Wan2GP和ComfyUI-MagCache。 要求 - Linux、Python 3.10+、支持CUDA的NVIDIA GPU,并根据使用的功能安装Flash Attention、Flex-Block-Attention、SageAttention和SGL-Kernel等注意力库。 模型权重在Hugging Face上分发,涵盖480p和720p的T2V/I2V变体、蒸馏版本和超分辨率模型。部分权重(例如某些稀疏和蒸馏的720p变体)标记为即将推出。README还链接了提示手册和arXiv报告。