Sobre o projeto

HunyuanVideo é um modelo base de vídeo open-source desenvolvido pela Tencent, projetado para geração de vídeo em larga escala. O repositório fornece definições de modelo PyTorch, pesos pré-treinados e código de inferência/amostragem. Principais recursos técnicos incluem: - Arquitetura Unificada de Geração de Imagem e Vídeo: Utiliza um design híbrido de Transformer "Dual-stream para Single-stream" com mecanismo de atenção completa, processando tokens de vídeo e texto independentemente antes de fundi-los para integração de informações multimodais. - Codificador de Texto MLLM: Utiliza um Modelo de Linguagem Grande Multimodal pré-treinado com estrutura apenas de Decoder como codificador de texto, oferecendo melhor alinhamento entre imagem e texto e raciocínio complexo em comparação com CLIP ou T5-XXL. - 3D VAE: Emprega um Causal 3D VAE com CausalConv3D para comprimir vídeos do espaço de pixels em um espaço latente compacto com razões de compressão de 4x para comprimento de vídeo, 8x para espaço e 16x para canais. - Reescrita de Prompt: Inclui um modelo de reescrita de prompt ajustado (baseado em Hunyuan-Large) com modos Normal e Master para adaptar prompts do usuário para melhores resultados de geração de vídeo. O modelo possui mais de 13 bilhões de parâmetros. O repositório suporta inferência em GPU única, inferência paralela multi-GPU via xDiT e pesos quantizados FP8 para redução do uso de memória GPU. Requer no mínimo 45GB de memória GPU (para 544x960x129f) ou 60GB (para 720x1280x129f), com 80GB recomendado. O projeto gerou múltiplos derivados, incluindo HunyuanVideo-I2V (imagem-para-vídeo), HunyuanVideo-Avatar (animação guiada por áudio) e HunyuanCustom (geração de vídeo personalizada). Integra-se com Diffusers e ComfyUI, com contribuições da comunidade oferecendo versões quantizadas, ferramentas de aceleração e várias otimizações.