منصوبے کے بارے میں

اوپن سورا ایک اوپن سورس پروجیکٹ ہے جو قابل رسید ماڈلز، ٹولز اور نفاذ کی تفصیلات فراہم کر کے موثر ویڈیو پروڈکشن کو عوامی بنانے کے لیے وقف ہے۔ یہ پروجیکٹ ویڈیو جنریشن کے لیے مکمل پائپ لائن پیش کرتا ہے، جس میں ڈیٹا پری پروسیسنگ، ٹریننگ ایکسلریشن (ColossalAI کا استعمال کرتے ہوئے)، اور انفرینس شامل ہیں۔ تازہ ترین ریلیز، اوپن سورا 2.0، میں 11B پیرامیٹر ماڈل شامل ہے۔ پروجیکٹ کی تکنیکی رپورٹ کے مطابق، اس ماڈل کو تقریباً $200K کے بجٹ کے ساتھ تربیت دی گئی اور یہ VBench بینچ مارک اور انسانی ترجیحی جائزوں میں HunyuanVideo (11B) اور Step-Video (30B) جیسے دیگر اوپن سورس ماڈلز کے برابر کارکردگی دکھاتا ہے۔ پروجیکٹ پچھلے ورژنز (1.0 سے 1.3) کو الگ برانچز پر برقرار رکھتا ہے، جس میں 3D-VAE، ریٹیفائیڈ فلو، اور مختلف اسپیشل-ٹیمپورل آرکیٹیکچرز جیسی صلاحیتوں میں ترقی کی دستاویزی تاریخ موجود ہے۔ اہم صلاحیتیں اور خصوصیات: - ٹیکسٹ ٹو امیج، ٹیکسٹ ٹو ویڈیو، امیج ٹو ویڈیو، اور ویڈیو ٹو ویڈیو جنریشن۔ - 2 سیکنڈ سے لے کر 16 سیکنڈ یا لامحدود وقت تک، اور 144p سے 720p تک ریزولیوشن کی حمایت، لچکدار ایسپیکٹ ریشو کے ساتھ۔ - مکمل طور پر اوپن سورس چیک پوائنٹس اور ٹریننگ اسکرپٹس، جو صارفین کو اپنے ماڈلز کی تربیت یا فائن ٹیوننگ کی اجازت دیتے ہیں۔ - ہر ورژن کے لیے آرکیٹیکچر، ٹریننگ عمل، اور ایوالیویشن میٹرکس کی تفصیلی تکنیکی رپورٹس۔ - انٹرایکٹو ٹیسٹنگ کے لیے Hugging Face Spaces پر میزبان Gradio بیسڈ ڈیمو۔ یہ پروجیکٹ ویڈیو آٹو انکوڈرز کی تربیت، تشخیص، اور ماڈلز کی ڈپلائمنٹ کے لیے جامع دستاویزات فراہم کرتا ہے، تاکہ مواد سازوں اور محققین کے لیے ویڈیو جنریشن کی پیچیدگیوں کو آسان بنایا جا سکے۔