প্রকল্প সম্পর্কে

Open-Sora হলো কার্যকর ও দক্ষ ভিডিও উৎপাদনকে গণতান্ত্রিক করার লক্ষ্যে নির্মিত একটি ওপেন-সোর্স প্রকল্প, যা অ্যাক্সেসযোগ্য মডেল, সরঞ্জাম ও বাস্তবায়ন পরামর্শ সরবরাহ করে। প্রকল্পটি ভিডিও উৎপাদনের জন্য সম্পূর্ণ পাইপলাইন প্রদান করে, যার মধ্যে ডেটা প্রিপ্রসেসিং, প্রশিক্ষণ ত্বরান্বয়ন (ColossalAI ব্যবহার করে), এবং ইনফারেন্স অন্তর্ভুক্ত। সর্বশেষ রিলিজ Open-Sora 2.0-এ 11B প্যারামিটার বিশিষ্ট একটি মডেল রয়েছে। প্রকল্পটির টেকনিক্যাল রিপোর্ট অনুযায়ী, এই মডেলটি মাত্র প্রায় $200K বাজেটে প্রশিক্ষিত হয়েছিল এবং VBench বেনচমার্কে এবং মানব পছন্দ মূল্যায়নে HunyuanVideo (11B) ও Step-Video (30B)-এর সমতুল্য পারফরম্যান্স অর্জন করেছে। প্রকল্পটি 1.0 থেকে 1.3 পর্যন্ত আগের সংস্করণগুলো আলাদা ব্রাঞ্চে বজায় রেখেছে, যেখানে 3D-VAE, rectified flow, এবং বিভিন্ন স্থান-কালীয় আর্কিটেকচারের মতো ক্ষমতার ক্রমিক উন্নতি নথিভুক্ত করা হয়েছে। প্রধান সক্ষমতা ও বৈশিষ্ট্যগুলোর মধ্যে রয়েছে: - টেক্সট-টু-ইমেজ, টেক্সট-টু-ভিডিও, ইমেজ-টু-ভিডিও, এবং ভিডিও-টু-ভিডিও জেনারেশন。 - 2 সেকেন্ড থেকে 16 সেকেন্ড বা অসীম সময় পর্যন্ত পরিবর্তনশীল ভিডিও দৈর্ঘ্য এবং 144p থেকে 720p পর্যন্ত রেজোলিউশনের সমর্থন, যার সাথে নমনীয় অ্যাসপেক্ট রেশিও রয়েছে। - সম্পূর্ণ ওপেন-সোর্স চেকপয়েন্ট এবং প্রশিক্ষণ স্ক্রিপ্ট, যা ব্যবহারকারীদের তাদের নিজস্ব মডেল প্রশিক্ষণ বা ফাইন-ট্যুনিং করতে সক্ষম করে। - প্রতিটি সংস্করণের জন্য আর্কিটেকচার, প্রশিক্ষণ প্রক্রিয়া এবং মূল্যায়ন মেট্রিক্স নথিভুক্ত করা বিস্তারিত টেকনিক্যাল রিপোর্ট। - মিথস্ক্রিয়ামূলক পরীক্ষার জন্য Hugging Face Spaces-এ Gradio-ভিত্তিক ডেমো。 প্রকল্পটি বিষয় সৃষ্টিকারী এবং গবেষকদের জন্য ভিডিও জেনারেশন জটিলতা সহজ করার লক্ষ্যে প্রশিক্ষণ, ভিডিও অটোঅ্যানকোডার মূল্যায়ন এবং মডেল部署 সম্পর্কে বিস্তারিত নথি প্রদান করে।