প্রকল্প সম্পর্কে
HunyuanVideo হলো টেনসেন্ট কর্তৃক উন্নত একটি ওপেন-সোর্স ভিডিও ফাউন্ডেশন মডেল, যা ব্যাপক স্কেলে ভিডিও তৈরির জন্য ডিজাইন করা হয়েছে। এই রিপোজিটরি PyTorch মডেল সংজ্ঞা, প্রি-ট্রেইনড ওয়েটস এবং ইনফারেন্স/স্যাম্পলিং কোড প্রদান করে।
প্রধান প্রযুক্তিগত বৈশিষ্ট্য:
- ইউনাইফাইড ইমেজ এবং ভিডিও জেনারেটিভ আর্কিটেকচার: "Dual-stream to Single-stream" হাইব্রিড ট্রান্সফরমার ডিজাইন ব্যবহার করে, যেখানে ভিডিও এবং টেক্সট টোকেনগুলো স্বাধীনভাবে প্রক্রিয়া করে পরে মাল্টিমোডাল তথ্য একত্রীকরণের জন্য ফিউজ করা হয়।
- MLLM টেক্সট এনকোডার: ডিকোডার-ওনারি কাঠামো বিশিষ্ট একটি প্রি-ট্রেইনড মাল্টিমোডাল লার্জ ল্যাঙ্গুয়েজ মডেল ব্যবহার করে, যা CLIP বা T5-XXL-এর তুলনায় উন্নত ইমেজ-টেক্সট অ্যালাইনমেন্ট এবং জটিল যুক্তিপরায়ণতা প্রদান করে।
- 3D VAE: CausalConv3D সমন্বিত একটি Causal 3D VAE ব্যবহার করে পিক্সেল-স্পেস ভিডিওকে সংকুচিত ল্যাটেন্ট স্পেসে রূপান্তর করে, যেখানে ভিডিও দৈর্ঘ্যের জন্য 4x, স্থানের জন্য 8x এবং চ্যানেলের জন্য 16x কমপ্রেশন রেট রয়েছে।
- প্রম্পট রিরাইট: Hunyuan-Large-এর উপর ভিত্তি করে একটি ফাইন-টিউন করা প্রম্পট রিরাইট মডেল অন্তর্ভুক্ত রয়েছে, যা Normal এবং Master মোড সহ ব্যবহারকারীর প্রম্পটগুলো ভিডিও জেনারেশনের মান উন্নত করতে অভিযোজিত করে।
মডেলটির ১৩ বিলিয়নের বেশি প্যারামিটার রয়েছে। রিপোজিটরি সিঙ্গেল-GPU ইনফারেন্স, xDiT-এর মাধ্যমে মাল্টি-GPU প্যারালাল ইনফারেন্স এবং FP8 কোয়ান্টাইজড ওয়েটস (GPU মেমোরি কমানোর জন্য) সমর্থন করে। ন্যূনতম ৪৫GB GPU মেমোরি (544x960x129f রেজোলিউশনের জন্য) অথবা ৬০GB (720x1280x129f রেজোলিউশনের জন্য) প্রয়োজন, ৮০GB সুপারিশ করা হয়।
এই প্রজেক্ট থেকে HunyuanVideo-I2V (ইমেজ-টু-ভিডিও), HunyuanVideo-Avatar (অডিও-চালিত অ্যানিমেশন) এবং HunyuanCustom (কাস্টমাইজড ভিডিও জেনারেশন) এর মতো একাধিক ডেরিভেটিভ তৈরি হয়েছে। এটি Diffusers এবং ComfyUI-এর সাথে integrate হয়, এবং কমিউনিটি অবদানকারীদের দ্বারা কোয়ান্টাইজড ভার্সন, এক্সেলারেশন টুলস এবং বিভিন্ন অপ্টিমাইজেশন প্রদান করা হয়েছে।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.