প্রকল্প সম্পর্কে

Wan2.2 হল Wan-AI-এর তৈরি একটি ওপেন-সোর্স ভিডিও জেনারেটিভ মডেল স্যুট। এটি ভিডিও ডিফিউশন মডেলে Mixture-of-Experts (MoE) আর্কিটেকচার প্রবর্তন করেছে, যেখানে ডিনয়েজিং প্রক্রিয়াটিকে বিভিন্ন টাইমস্টেপে বিশেষজ্ঞ মডেলগুলোর মাধ্যমে ভাগ করে দেওয়া হয়, ফলে কম্পিউটেশনাল খরচ ধরে রেখে ক্ষমতা বাড়ানো যায়। এই স্যুটটি একাধিক জেনারেশন টাস্ক সমর্থন করে: - Text-to-Video (T2V-A14B): টেক্সট প্রম্পট থেকে 480P এবং 720P রেজোলিশনে ভিডিও তৈরি করে। - Image-to-Video (I2V-A14B): একটি রেফারেন্ ইমেজ এবং টেক্সট প্রম্পট থেকে ভিডিও তৈরি করে। - Text-Image-to-Video (TI2V-5B): 5B প্যারামিটারের একটি মডেল, যা Wan2.2-VAE ব্যবহার করে 16x16x4 কম্প্রেশন রেশিওতে; 720P 24fps সমর্থন করে। কমপক্ষে 24GB VRAM-সমৃদ্ধ কনজিউমার-গ্রে GPU-তে (যেমন RTX 4090) চালানো যায়। - Speech-to-Video (S2V-14B): অডিও-ড্রিভেন সিনেমাটিক ভিডিও জেনারেশন মডেল, যা অডিও ইনপুট, রেফারেন্স ইমেজ এবং ঐচ্ছিক টেক্সট প্রম্পট গ্রহণ করে। পোজ ভিডিও প্যারামিটারের মাধ্যমে পোজ-ড্রিভেন জেনারেশন সমর্থন করে। CosyVoice-এর মাধ্যমে text-to-speech সিন্থেসিসও ইন্টিগ্রেট করা যায়। - Character Animation and Replacement (Animate-14B): একটি ভিডিও এবং ক্যারেক্টার ইমেজ ইনপুট হিসেবে নেয়; অ্যানিমেশন মোডে ক্যারেক্টার ইনপুট ভিডিওর মোশন অনুকরণ করে, বা রিপ্লেসমেন্ট মোডে ইনপুট ভিডিওতে ক্যারেক্টার প্রতিস্থাপন করে। রিপোজিটরিতে PyTorch FSDP এবং DeepSpeed Ulysses-ভিত্তিক single-GPU এবং multi-GPU ইনফারেন্স স্ক্রিপ্ট রয়েছে। Dashscope API বা লোকাল Qwen মডেলের মাধ্যে প্রম্পট এক্সটেনশন সমর্থিত, যা জেনারেটেড ভিডিওর বিবরণ সমৃদ্ধ করে। মডেল ওয়েট Hugging Face এবং ModelScope-এ পাওয়া যায়। Wan2.2 ComfyUI এবং Hugging Face Diffusers-এ ইন্টিগ্রেটেড হয়েছে। কমিউনিটি এতে সংশ্লিষ্ট প্রজেক্ট তৈরি করেছে, যেমন LightX2V (লাইটওয়েট ইনফারেন্স ফ্রেমওয়ার্ক), FastVideo (ডিস্টিলড মডেল এবং স্পার্স অ্যাটেনশন), Cache-dit (ক্যাশ অ্যাক্সিলারেশন), DiffSynth-Studio (লো-VRAM অফলোড, FP8 কোয়ান্টাইজেশন, LoRA ট্রেনিং), এবং Kijai-এর ComfyUI WanVideoWrapper।