这个项目能做什么
Wan2.2 是 Wan-AI 开发的开源视频生成模型套件,将 Mixture-of-Experts(MoE)架构引入视频扩散模型,通过在时间步上拆分去噪过程并使用专门的专家模型,在保持计算成本的同时提升模型容量。该套件支持多种生成任务:
- Text-to-Video(T2V-A14B):根据文本提示生成 480P 和 720P 分辨率的视频。
- Image-to-Video(I2V-A14B):根据参考图像和文本提示生成视频。
- Text-Image-to-Video(TI2V-5B):5B 参数模型,采用 Wan2.2-VAE,压缩比为 16x16x4,支持 720P@24fps,可在显存不低于 24GB 的消费级 GPU(如 RTX 4090)上运行。
- Speech-to-Video(S2V-14B):音频驱动的电影级视频生成模型,输入音频、参考图像和可选文本提示,支持通过 pose video 参数进行姿态驱动生成,可集成 CosyVoice 进行文本转语音合成。
- Character Animation and Replacement(Animate-14B):输入视频和角色图像,可在动画模式下让角色模仿输入视频动作,或在替换模式下替换输入视频中的角色。
该仓库提供基于 PyTorch FSDP 和 DeepSpeed Ulysses 的单卡与多卡推理脚本以加速推理。支持通过 Dashscope API 或本地 Qwen 模型进行提示词扩展,以丰富生成视频细节。模型权重可在 Hugging Face 和 ModelScope 下载。
Wan2.2 已集成到 ComfyUI 和 Hugging Face Diffusers。社区还开发了相关项目,包括 LightX2V(轻量级推理框架)、FastVideo(蒸馏模型与稀疏注意力)、Cache-dit(缓存加速)、DiffSynth-Studio(低显存卸载、FP8 量化、LoRA 训练)以及 Kijai 的 ComfyUI WanVideoWrapper。
评论
0 评分人数达到10人后显示
登录后参与讨论。