Sobre el proyecto

HunyuanVideo es un modelo base de vídeo de código abierto desarrollado por Tencent, diseñado para la generación de vídeo a gran escala. El repositorio proporciona definiciones de modelos PyTorch, pesos preentrenados y código de inferencia/muestreo. Las características técnicas clave incluyen: - Arquitectura generativa unificada de imagen y vídeo: Utiliza un diseño híbrido de Transformer «dual-stream a single-stream» con mecanismo de atención completa, procesando tokens de vídeo y texto de forma independiente antes de fusionarlos para la integración de información multimodal. - Codificador de texto MLLM: Utiliza un Modelo de Lenguaje Grande Multimodal preentrenado con estructura solo de decodificador como codificador de texto, ofreciendo mejor alineación imagen-texto y razonamiento complejo en comparación con CLIP o T5-XXL. - VAE 3D: Emplea un VAE 3D causal con CausalConv3D para comprimir vídeos del espacio pixel a un espacio latente compacto con ratios de compresión de 4x para la longitud del vídeo, 8x para el espacio y 16x para los canales. - Reescritura de prompts: Incluye un modelo de reescritura de prompts ajustado (basado en Hunyuan-Large) con modos Normal y Master para adaptar los prompts del usuario a fin de obtener mejores resultados de generación de vídeo. El modelo cuenta con más de 13 mil millones de parámetros. El repositorio admite inferencia con GPU única, inferencia paralela multi-GPU mediante xDiT y pesos cuantizados FP8 para reducir el uso de memoria GPU. Requiere un mínimo de 45 GB de memoria GPU (para 544x960x129f) o 60 GB (para 720x1280x129f), recomendándose 80 GB. El proyecto ha generado múltiples derivados, incluyendo HunyuanVideo-I2V (imagen a vídeo), HunyuanVideo-Avatar (animación impulsada por audio) y HunyuanCustom (generación de vídeo personalizado). Se integra con Diffusers y ComfyUI, con contribuciones de la comunidad que ofrecen versiones cuantizadas, herramientas de aceleración y varias optimizaciones.