这个项目能做什么
HunyuanVideo是腾讯开发的开源视频基础模型,专为大规模视频生成设计。该仓库提供PyTorch模型定义、预训练权重以及推理/采样代码。
关键技术特性包括:
- 统一的图像与视频生成架构:采用"双流到单流"混合Transformer设计,配合全注意力机制,在融合前独立处理视频和文本token,实现多模态信息整合。
- MLLM文本编码器:采用预训练的Decoder-Only结构多模态大语言模型作为文本编码器,相比CLIP或T5-XXL提供更优的图文对齐和复杂推理能力。
- 3D VAE:采用Causal 3D VAE与CausalConv3D,将像素空间视频压缩至紧凑潜空间,压缩比为视频长度4x、空间8x、通道16x。
- 提示词重写:包含基于Hunyuan-Large微调的提示词重写模型,提供Normal和Master两种模式,适配用户提示词以获得更好的视频生成效果。
该模型拥有超过130亿参数。仓库支持单GPU推理、通过xDiT实现的多GPU并行推理,以及FP8量化权重以降低GPU显存占用。最低需要45GB显存(544x960x129f分辨率)或60GB(720x1280x129f分辨率),推荐80GB。
该项目衍生出多个版本,包括HunyuanVideo-I2V(图生视频)、HunyuanVideo-Avatar(音频驱动动画)和HunyuanCustom(定制化视频生成)。已集成Diffusers和ComfyUI,社区贡献提供了量化版本、加速工具及多种优化方案。
评论
0 评分人数达到10人后显示
登录后参与讨论。