Sobre el proyecto
HunyuanVideo-1.5 es un modelo de generación de video de código abierto lanzado por Tencent Hunyuan. Es un modelo ligero de transformador de difusión (DiT) con 8.3 mil millones de parámetros, diseñado para ejecutarse en GPUs NVIDIA de consumo con tan solo 14 GB de VRAM cuando se habilita la descarga de modelos. El repositorio proporciona código de inferencia, pesos del modelo, código de entrenamiento y scripts de ajuste fino LoRA.
Capacidades
- Generación de texto a video (T2V) e imagen a video (I2V) a 480p y 720p, con una red de superresolución de pocos pasos que amplía las salidas a 1080p.
- Un VAE causal 3D con compresión espacial 16x y temporal 4x, más un mecanismo de Atención de Azulejos Deslizantes y Selectiva (SSTA) destinado a reducir el cómputo para secuencias largas.
- Comprensión de prompts bilingües mediante codificación de texto consciente de glifos, y reescritura automática opcional de prompts a través de un endpoint compatible con vLLM (los ejemplos hacen referencia a modelos Qwen3).
- Múltiples opciones de aceleración: modelos destilados con CFG, modelos destilados por pasos (I2V 480p, se recomiendan 8 o 12 pasos), atención dispersa, SageAttention y caché de características (deepcache, teacache, taylorcache). También se admite inferencia GEMM FP8.
- Inferencia distribuida mediante torchrun en múltiples GPUs, con descarga configurable y descarga por grupos.
Entrenamiento e integración
- El script de entrenamiento (train.py) admite entrenamiento distribuido, FSDP, paralelismo de contexto y checkpointing de gradientes, utilizando el optimizador Muon.
- Las integraciones listadas incluyen Hugging Face Diffusers, ComfyUI (con una guía de uso y un plugin comunitario), LightX2V, Wan2GP y ComfyUI-MagCache.
Requisitos
- Linux, Python 3.10+, GPU NVIDIA compatible con CUDA e instalación de bibliotecas de atención como Flash Attention, Flex-Block-Attention, SageAttention y SGL-Kernel según las funciones utilizadas.
Los pesos del modelo se distribuyen en Hugging Face, cubriendo variantes T2V/I2V de 480p y 720p, versiones destiladas y modelos de superresolución. Algunos pesos (por ejemplo, ciertas variantes dispersas y destiladas de 720p) están marcados como próximamente disponibles. El README también enlaza un manual de prompts y un informe arXiv.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.