Об этом проекте

HunyuanVideo-1.5 — это модель генерации видео с открытым исходным кодом, выпущенная Tencent Hunyuan. Это легковесная диффузионная модель трансформера (DiT) с 8,3 миллиардами параметров, предназначенная для работы на потребительских GPU NVIDIA с объемом видеопамяти от 14 ГБ при включенной выгрузке модели. Репозиторий предоставляет код инференса, веса модели, код обучения и скрипты тонкой настройки LoRA. Возможности - Генерация из текста в видео (T2V) и из изображения в видео (I2V) в разрешениях 480p и 720p, с сетью суперразрешения в несколько шагов, повышающей выходное разрешение до 1080p. - 3D-каузальный VAE с 16-кратным пространственным и 4-кратным временным сжатием, а также механизм Selective and Sliding Tile Attention (SSTA), предназначенный для снижения вычислительной нагрузки на длинных последовательностях. - Двуязычное понимание промптов с помощью глиф-ориентированного кодирования текста и опциональная автоматическая перезапись промптов через совместимую с vLLM конечную точку (примеры ссылаются на модели Qwen3). - Несколько вариантов ускорения: CFG-дистиллированные модели, дистиллированные по шагам модели (480p I2V, рекомендуется 8 или 12 шагов), разреженное внимание, SageAttention и кэширование признаков (deepcache, teacache, taylorcache). Также поддерживается инференс FP8 GEMM. - Распределенный инференс через torchrun на нескольких GPU с настраиваемой выгрузкой и групповой выгрузкой. Обучение и интеграция - Скрипт обучения (train.py) поддерживает распределенное обучение, FSDP, параллелизм контекста и контрольные точки градиента, используя оптимизатор Muon. - Перечисленные интеграции включают Hugging Face Diffusers, ComfyUI (с руководством по использованию и плагином сообщества), LightX2V, Wan2GP и ComfyUI-MagCache. Требования - Linux, Python 3.10+, GPU NVIDIA с поддержкой CUDA, а также установка библиотек внимания, таких как Flash Attention, Flex-Block-Attention, SageAttention и SGL-Kernel, в зависимости от используемых функций. Веса модели распространяются на Hugging Face и охватывают варианты T2V/I2V 480p и 720p, дистиллированные версии и модели суперразрешения. Некоторые веса (например, определенные разреженные и дистиллированные варианты 720p) помечены как «скоро». В README также есть ссылки на руководство по промптам и отчет arXiv.