프로젝트 소개

Wan2.2는 Wan-AI가 개발한 오픈소스 비디오 생성 모델 제품군이다. 이 제품군은 Mixture-of-Experts(MoE) 아키텍처를 비디오 확산 모델에 도입하여, 노이즈 제거 과정을 시간 단계별로 분리하고 전문가 모델을 활용함으로써 용량을 늘리면서도 계산 비용을 유지한다. Wan2.2는 다음과 같은 여러 생성 작업을 지원한다. - Text-to-Video(T2V-A14B): 텍스트 프롬프트로 480P 및 720P 해상도의 비디오를 생성한다. - Image-to-Video(I2V-A14B): 참조 이미지와 스트 프롬프트를 입력으로 비디오를 생성한다. - Text-Image-to-Video(TI2V-5B): Wan2.2-VAE를 사용하며 16x16x4 압축을 가진 5B 규모의 모델로, 720P 24fps를 지원한다. RTX 4090 등 VRAM 24GB 이상의 소비자용 GPU에서 실행할 수 있다. - Speech-to-Video(S2V-14B): 오디오 입력, 참조 이미지, 선택적 텍스트 프롬프트를 받는 오디오 기반 영화적 비디오 생성 모델이다. 포즈 비디오 매개변수를 통한 포즈 기반 생성을 지원하며, CosyVoice를 통한 텍스트-to-음성 합성과 통합할 수 있다. - Character Animation and Replacement(Animate-14B): 비디오와 캐릭터 이미지를 입력으로 받아, 애니메이션 모드(입력 비디오의 동작을 캐릭터가 따라 함) 또는 교체 모드(입력 비디오의 캐릭터를 교체)로 비디오를 생성한다. 저장소는 PyTorch FSDP과 DeepSpeed Ulysses를 활용한 단일 GPU 및 다중 GPU 추론 스크립트를 제공한다. Dashscope API 또는 로컬 Qwen 모델을 통한 프롬프트 확장을 지원하여 생성된 비디오의 디테일을 풍부하게 한다. 모델 가중치는 Hugging Face와 ModelScope에서 제공된다. Wan2.2는 ComfyUI와 Hugging Face Diffusers에 통합되었다. 커뮤니티에서는 LightX2V(경량 추론 프레임워크), FastVideo(소 어텐션을 적용한 증류 모델), Cache-dit(캐시 가속), DiffSynth-Studio(저VRAM 오프로드, FP8 양자화, LoRA 련), Kijai의 ComfyUI WanVideoWrapper 등의 관련 프로젝트가 개발되었다.