Об этом проекте
Wan2.1 — это открытый набор больших видеогенеративных моделей. Он поддерживает множество задач, включая Text-to-Video (T2V), Image-to-Video (I2V), First-Last-Frame-to-Video (FLF2V), редактирование видео, Text-to-Image и Video-to-Audio. В репозитории представлены чекпоинты моделей на 1,3B и 14B параметров, поддерживающие разрешения 480P и 720P.
Ключевые возможности:
- Поддержка потребительских GPU: модель T2V-1.3B требует 8,19 ГБ VRAM, что позволяет генерировать видео на обычных видеокартах.
- Генерация визуального текста: способен создавать китайский и английский текст в видео.
- Wan-VAE: видео VAE для кодирования и декодирования 1080P-видео любой длины с сохранением временной информации.
- VACE: универсальная модель для создания и редактирования видео.
Репозиторий предоставляет скрипты инференса на одной и нескольких GPU с использованием FSDP и xDiT USP (стратегии Ulysses и Ring). Поддерживается расширение промптов через Dashscope API или локальные модели Qwen. Обеспечена интеграция с Diffusers, ComfyUI и Gradio-демо. Вес модели доступен на Hugging Face и ModelScope.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.