프로젝트 소개

HunyuanVideo는 텐센트가 개발한 대규모 영상 생성을 위한 오픈소스 비디오 파운데이션 모델입니다. 해당 저장소는 PyTorch 모델 정의, 사전 훈련 가중치, 추론/샘플링 코드를 제공합니다. 주요 기술 특징은 다음과 같습니다: - 통합 이미지 및 영상 생성 아키텍처: "Dual-stream to Single-stream" 하이브리드 Transformer 설계와 전체 주의 메커니즘을 사용하여, 영상과 텍스트 토큰을 독립적으로 처리한 후 융합하여 다중모달 정보를 통합합니다. - MLLM 텍스트 인코더: Decoder-Only 구조를 가진 사전 훈련 Multimodal Large Language Model을 텍스트 인코더로 활용하여, CLIP이나 T5-XXL 대비 더 나은 이미지-텍스트 정렬과 복잡한 추론 능력을 제공합니다. - 3D VAE: CausalConv3D를 포함한 Causal 3D VAE를 채택하여 픽셀 공간 영상을 압축 비율 4x(영상 길이), 8x(공간), 16x(채널)의 컴팩트한 잠재 공간으로 압축합니다. - 프롬프트 재작성: Hunyuan-Large 기반의 미세 조정 프롬프트 재작성 모델을 포함하며, Normal과 Master 모드를 제공하여 사용자 프롬프트를 적응시켜 더 나은 영상 생성 결과를 도출합니다. 모델은 130억 개 이상의 파라미터를 보유하고 있습니다. 저장소는 단일 GPU 추론, xDiT를 통한 다중 GPU 병렬 추론, GPU 메모리 사용량을 줄이기 위한 FP8 양자화 가중치를 지원합니다. 최소 45GB GPU 메모리(544x960x129f 기준) 또는 60GB(720x1280x129f 기준)가 필요하며, 80GB 권장됩니다. 본 프로젝트는 HunyuanVideo-I2V(이미지-영상), HunyuanVideo-Avatar(오디오 기반 애니메이션), HunyuanCustom(맞춤형 영상 생성)을 포함한 여러 파생 모델을 탄생시켰습니다. Diffusers 및 ComfyUI와 통합되며, 커뮤니티 기여를 통해 양자화 버전, 가속 도구 및 다양한 최적화가 제공됩니다.