这个项目能做什么

Wan2.1 是一套开放且先进的大规模视频生成模型套件。它支持多种任务,包括文本生成视频(T2V)、图像生成视频(I2V)、首末帧生成视频(FLF2V)、视频编辑、文本生成图像以及视频生成音频。该仓库提供了 1.3B 和 14B 参数模型的模型检查点,支持 480P 和 720P 分辨率。 主要能力包括: - 消费级 GPU 支持:T2V-1.3B 模型仅需 8.19 GB 显存,可在普通 GPU 上生成视频。 - 视觉文本生成:能够在视频中生成中文和英文文本。 - Wan-VAE:一种视频 VAE,可对任意长度的 1080P 视频进行编码和解码,同时保留时序信息。 - VACE:一个用于视频创作和编辑的一体化模型。 该仓库提供基于 FSDP 和 xDiT USP(Ulysses 与 Ring 策略)的单 GPU 和多 GPU 推理脚本。支持通过 Dashscope API 或本地 Qwen 模型进行提示词扩展。同时提供与 Diffusers、ComfyUI 和 Gradio 演示的集成。模型权重可在 Hugging Face 和 ModelScope 上获取。