Sobre el proyecto
HunyuanVideo es un modelo base de vídeo de código abierto desarrollado por Tencent, diseñado para la generación de vídeo a gran escala. El repositorio proporciona definiciones de modelos PyTorch, pesos preentrenados y código de inferencia/muestreo.
Las características técnicas clave incluyen:
- Arquitectura generativa unificada de imagen y vídeo: Utiliza un diseño híbrido de Transformer «dual-stream a single-stream» con mecanismo de atención completa, procesando tokens de vídeo y texto de forma independiente antes de fusionarlos para la integración de información multimodal.
- Codificador de texto MLLM: Utiliza un Modelo de Lenguaje Grande Multimodal preentrenado con estructura solo de decodificador como codificador de texto, ofreciendo mejor alineación imagen-texto y razonamiento complejo en comparación con CLIP o T5-XXL.
- VAE 3D: Emplea un VAE 3D causal con CausalConv3D para comprimir vídeos del espacio pixel a un espacio latente compacto con ratios de compresión de 4x para la longitud del vídeo, 8x para el espacio y 16x para los canales.
- Reescritura de prompts: Incluye un modelo de reescritura de prompts ajustado (basado en Hunyuan-Large) con modos Normal y Master para adaptar los prompts del usuario a fin de obtener mejores resultados de generación de vídeo.
El modelo cuenta con más de 13 mil millones de parámetros. El repositorio admite inferencia con GPU única, inferencia paralela multi-GPU mediante xDiT y pesos cuantizados FP8 para reducir el uso de memoria GPU. Requiere un mínimo de 45 GB de memoria GPU (para 544x960x129f) o 60 GB (para 720x1280x129f), recomendándose 80 GB.
El proyecto ha generado múltiples derivados, incluyendo HunyuanVideo-I2V (imagen a vídeo), HunyuanVideo-Avatar (animación impulsada por audio) y HunyuanCustom (generación de vídeo personalizado). Se integra con Diffusers y ComfyUI, con contribuciones de la comunidad que ofrecen versiones cuantizadas, herramientas de aceleración y varias optimizaciones.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.