প্রকল্প সম্পর্কে
FramePack হলো "Frame Context Packing and Drift Prevention in Next-Frame-Prediction Video Diffusion Models" পেপারের অফিসিয়াল ইমপ্লিমেন্টেশন এবং ডেস্কটপ সফটওয়্যার। এটি একটি next-frame (next-frame-section) প্রেডিকশন নিউরাল নেটওয়ার্ক স্ট্রাকচার যা প্রগতিশীলভাবে ভিডিও তৈরি করে।
মূল প্রযুক্তিগত পদ্ধতি: FramePack ইনপুট কনটেক্সটগুলোকে একটি নির্দিষ্ট দৈর্ঘ্যে কম্প্রেস করে যাতে ভিডিওর দৈর্ঘ্যের ওপর জেনারেশন ওয়ার্কলোড নির্ভর না করে। এটি ল্যাপটপ GPU-তেও 13B মডেল ব্যবহার করে প্রচুর সংখ্যক ফ্রেম প্রসেস করতে সাহায্য করে। লেখকরা এটিকে "video diffusion, but feels like image diffusion" হিসেবে বর্ণনা করেছেন। এটি ইমেজ ডিফিউশন ট্রেনিংয়ের মতো বড় ব্যাচ সাইজ দিয়েও প্রশিক্ষণ দেওয়া যেতে পারে।
হার্ডওয়্যার প্রয়োজনীয়তা: fp16 এবং bf16 সাপোর্ট করে এমন Nvidia RTX 30XX, 40XX, বা 50XX সিরিজের GPU (GTX 10XX/20XX পরীক্ষা করা হয়নি), Linux বা Windows, এবং কমপক্ষে 6GB GPU মেমরি। একটি 13B মডেল ব্যবহার করে 30fps-এ ১ মিনিটের ভিডিও (১৮০০ ফ্রেম) তৈরি করতে সর্বনিম্ন প্রয়োজনীয় GPU মেমরি হলো 6GB। সফটওয়্যারটি একটি Gradio-ভিত্তিক GUI প্রদান করে যেখানে ব্যবহারকারীরা বাম দিকে একটি ছবি আপলোড করতে পারেন এবং প্রম্পট লিখতে পারেন, এবং ডান দিকে তৈরি করা ভিডিও এবং ল্যাটেন্ট প্রিভিউ দেখতে পারেন। ভিডিওগুলো সেকশন অনুযায়ী তৈরি করা হয় এবং পুরো প্রক্রিয়া জুড়ে ভিজ্যুয়াল ফিডব্যাক প্রদান করা হয়।
ইনস্টলেশন অপশনের মধ্যে রয়েছে একটি Windows ওয়ান-ক্লিক প্যাকেজ (CUDA 12.6 + PyTorch 2.6) এবং Python 3.10 সহ pip-এর মাধ্যমে Linux ইনস্টলেশন। সফটওয়্যারটি PyTorch attention, xformers, flash-attn, এবং sage-attention কার্নেল সাপোর্ট করে। TeaCache অ্যাক্সিলারেশন উপলব্ধ থাকলেও এটি লসলেস নয় বলে উল্লেখ করা হয়েছে, যা ফলাফলে প্রভাব ফেলতে পারে। রিপোজিটরিতে স্যানিটি চেক উদাহরণ এবং প্রম্পটিং নির্দেশিকা রয়েছে, যেখানে সংক্ষিপ্ত মোশন-ফোকাসড প্রম্পট ব্যবহারের পরামর্শ দেওয়া হয়েছে।
রিপোজিটরিটি স্পষ্টভাবে সতর্ক করে যে এটিই একমাত্র অফিসিয়াল FramePack ওয়েবসাইট এবং অন্যান্য অসংখ্য ডোমেইন (framepack.co, framepack.ai, ইত্যাদি) ভুয়া এবং সেগুলো ব্যবহার করা উচিত নয়।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.