这个项目能做什么

Wan2.2 是 Wan-AI 开发的开源视频生成模型套件,将 Mixture-of-Experts(MoE)架构引入视频扩散模型,通过在时间步上拆分去噪过程并使用专门的专家模型,在保持计算成本的同时提升模型容量。该套件支持多种生成任务: - Text-to-Video(T2V-A14B):根据文本提示生成 480P 和 720P 分辨率的视频。 - Image-to-Video(I2V-A14B):根据参考图像和文本提示生成视频。 - Text-Image-to-Video(TI2V-5B):5B 参数模型,采用 Wan2.2-VAE,压缩比为 16x16x4,支持 720P@24fps,可在显存不低于 24GB 的消费级 GPU(如 RTX 4090)上运行。 - Speech-to-Video(S2V-14B):音频驱动的电影级视频生成模型,输入音频、参考图像和可选文本提示,支持通过 pose video 参数进行姿态驱动生成,可集成 CosyVoice 进行文本转语音合成。 - Character Animation and Replacement(Animate-14B):输入视频和角色图像,可在动画模式下让角色模仿输入视频动作,或在替换模式下替换输入视频中的角色。 该仓库提供基于 PyTorch FSDP 和 DeepSpeed Ulysses 的单卡与多卡推理脚本以加速推理。支持通过 Dashscope API 或本地 Qwen 模型进行提示词扩展,以丰富生成视频细节。模型权重可在 Hugging Face 和 ModelScope 下载。 Wan2.2 已集成到 ComfyUI 和 Hugging Face Diffusers。社区还开发了相关项目,包括 LightX2V(轻量级推理框架)、FastVideo(蒸馏模型与稀疏注意力)、Cache-dit(缓存加速)、DiffSynth-Studio(低显存卸载、FP8 量化、LoRA 训练)以及 Kijai 的 ComfyUI WanVideoWrapper。