Sobre o projeto

HunyuanVideo-1.5 é um modelo de geração de vídeo open-source lançado pela Tencent Hunyuan. É um modelo de difusão transformer (DiT) leve com 8,3 bilhões de parâmetros, projetado para rodar em GPUs NVIDIA de consumo com apenas 14 GB de VRAM quando o descarregamento de modelo é habilitado. O repositório fornece código de inferência, pesos de modelo, código de treinamento e scripts de ajuste fino LoRA. Capacidades - Geração texto-para-vídeo (T2V) e imagem-para-vídeo (I2V) em 480p e 720p, com uma rede de super-resolução de poucos passos que amplia saídas para 1080p. - Uma VAE causal 3D com compressão espacial de 16x e temporal de 4x, mais um mecanismo de Atenção de Tiles Deslizantes e Seletiva (SSTA) destinado a reduzir computação para sequências longas. - Compreensão de prompt bilíngue via codificação de texto ciente de glifos, e reescrita automática opcional de prompt através de um endpoint compatível com vLLM (exemplos referenciam modelos Qwen3). - Múltiplas opções de aceleração: modelos destilados por CFG, modelos destilados por passos (480p I2V, 8 ou 12 passos recomendados), atenção esparsa, SageAttention e cache de características (deepcache, teacache, taylorcache). Inferência FP8 GEMM também é suportada. - Inferência distribuída via torchrun em múltiplas GPUs, com descarregamento configurável e descarregamento em grupo. Treinamento e integração - Script de treinamento (train.py) suporta treinamento distribuído, FSDP, paralelismo de contexto e checkpointing de gradiente, usando o otimizador Muon. - Integrações listadas incluem Hugging Face Diffusers, ComfyUI (com um guia de uso e um plugin da comunidade), LightX2V, Wan2GP e ComfyUI-MagCache. Requisitos - Linux, Python 3.10+, GPU NVIDIA compatível com CUDA e instalação de bibliotecas de atenção como Flash Attention, Flex-Block-Attention, SageAttention e SGL-Kernel, dependendo das funcionalidades usadas. Os pesos do modelo são distribuídos no Hugging Face, cobrindo variantes T2V/I2V em 480p e 720p, versões destiladas e modelos de super-resolução. Alguns pesos (por exemplo, certas variantes esparsas e destiladas em 720p) são marcados como em breve. O README também vincula um manual de prompts e um relatório arXiv.