프로젝트 소개

HunyuanVideo-1.5는 Tencent Hunyuan이 공개한 오픈소스 비디오 생성 모델입니다. 83억 개의 파라미터를 가진 경량 확산 트랜스포머(DiT) 모델로, 모델 오프로딩을 활성화하면 최소 14GB VRAM의 소비자용 NVIDIA GPU에서 실행할 수 있도록 설계되었습니다. 저장소에는 추론 코드, 모델 가중치, 학습 코드, LoRA 파인튜닝 스크립트가 포함되어 있습니다. 기능 - 480p 및 720p 해상도에서 텍스트-비디오(T2V) 및 이미지-비디오(I2V) 생성 지원, 출력을 1080p로 업스케일하는 몇 단계 초해상도 네트워크 포함. - 16배 공간 및 4배 시간 압축을 제공하는 3D 인과 VAE와, 긴 시퀀스의 계산량을 줄이기 위한 선택적 슬라이딩 타일 어텐션(SSTA) 메커니즘. - 글리프 인식 텍스트 인코딩을 통한 이중 언어 프롬프트 이해, vLLM 호환 엔드포인트를 통한 선택적 자동 프롬프트 재작성(Qwen3 모델 참조 예시). - 여러 가속 옵션: CFG 증류 모델, 단계 증류 모델(480p I2V, 8~12단계 권장), 희소 어텐션, SageAttention, 피처 캐싱(deepcache, teacache, taylorcache). FP8 GEMM 추론도 지원. - torchrun을 통한 다중 GPU 분산 추론, 구성 가능한 오프로딩 및 그룹 오프로딩 지원. 학습 및 통합 - 학습 스크립트(train.py)는 Muon 옵티마이저를 사용하여 분산 학습, FSDP, 컨텍스트 병렬, 그래디언트 체크포인팅을 지원. - 통합 목록: Hugging Face Diffusers, ComfyUI(사용 가이드 및 커뮤니티 플러그인 포함), LightX2V, Wan2GP, ComfyUI-MagCache. 요구 사항 - Linux, Python 3.10+, CUDA 지원 NVIDIA GPU, 사용 기능에 따라 Flash Attention, Flex-Block-Attention, SageAttention, SGL-Kernel과 같은 어텐션 라이브러리 설치 필요. 모델 가중치는 Hugging Face에 배포되며, 480p 및 720p T2V/I2V 변형, 증류 버전, 초해상도 모델을 포함합니다. 일부 가중치(예: 특정 희소 및 증류 720p 변형)는 곧 제공될 예정으로 표시됩니다. README에는 프롬프트 핸드북과 arXiv 보고서 링크도 포함되어 있습니다.