Об этом проекте

HunyuanVideo — это открытая видео-фундаментальная модель, разработанная Tencent, предназначенная для генерации видео в больших масштабах. Репозиторий содержит определения модели на PyTorch, предварительно обученные веса и код для инференса и сэмплирования. Ключевые технические особенности: - Единая архитектура генерации изображений и видео: использует гибридный Transformer-дизайн «Dual-stream to Single-stream» с механизмом полного внимания (full attention), обрабатывая токены видео и текста независимо перед их слиянием для мультимодальной интеграции информации. - MLLM Text Encoder: в качестве текстового энкодера используется предварительно обученная мультимодальная большая языковая модель (MLLM) с Decoder-Only структурой, обеспечивающая лучшее выравнивание изображения и текста и сложные рассуждения по сравнению с CLIP или T5-XXL. - 3D VAE: применяется причинный 3D VAE с CausalConv3D для сжатия пиксельных видео в компактное латентное пространство с коэффициентами сжатия 4x по длине видео, 8x по пространству и 16x по каналам. - Prompt Rewrite: включает дообученную модель переписывания промптов (на базе Hunyuan-Large) с нормальным (Normal) и мастер-режимом (Master) для адаптации пользовательских промптов и улучшения результатов генерации видео. Модель насчитывает более 13 миллиардов параметров. Репозиторий поддерживает инференс на одной GPU, много-GPU параллельный инференс через xDiT, а также FP8 квантованные веса для снижения потребления памяти GPU. Требуется минимум 45 ГБ памяти GPU (для разрешения 544x960x129f) или 60 ГБ (для 720x1280x129f), рекомендуется 80 ГБ. Проект породил несколько производных: HunyuanVideo-I2V (генерация видео по изображению), HunyuanVideo-Avatar (анимация на основе аудио) и HunyuanCustom (кастомизированная генерация видео). Интегрируется с Diffusers и ComfyUI, сообщество предоставляет квантованные версии, инструменты ускорения и различные оптимизации.