عن المشروع

يعتبر مشروع Open-Sora مبادرةً مفتوحة المصدر تركز على تبسيط إنتاج الفيديو بكفاءة من خلال توفير نماذج وأدوات ومعايير تنفيذية متاحة للجميع. يقدم المشروع خط أنابيب كاملًا لتوليد الفيديو، يشمل معالجة البيانات المسبقة، وتسريع التدريب (باستخدام ColossalAI)، والاستنتاج. تتضمن أحدث إصدار، وهو Open-Sora 2.0، نموذجًا مكونًا من 11 مليار معامل. وفقًا للتقرير الفني للمشروع، تم تدريب هذا النموذج بميزانية تقارب 200 ألف دولار أمريكي، وحقّق أداءً يعادل أداء النماذج مفتوحة المصدر الأخرى مثل HunyuanVideo (11B) وStep-Video (30B) على مقياس VBench وفي تقييمات التفضيل البشري. يحتفظ المشروع أيضًا بالإصدارات السابقة (من 1.0 إلى 1.3) على فروع منفصلة، موثقًا تطورًا تكراريًا في القدرات مثل 3D-VAE، وتدفق المستقيم (rectified flow)، وهندسات زمنية-مكانية متنوعة. تشمل القدرات والميزات الرئيسية: - توليد نصوص إلى صور، ونصوص إلى فيديو، وصور إلى فيديو، وفيديو إلى فيديو. - دعم أطوال فيديو متغيرة (من ثانيتين حتى 16 ثانية أو غير محدودة زمنيًا) ودقات تتراوح بين 144p و720p، مع نسب أبعاد مرنة. - نقاط تفتيش مفتوحة المصدر بالكامل وبرامج تدريب، مما يتيح للمستخدمين تدريب أو ضبط نماذجهم الخاصة. - تقارير فنية مفصلة توثق الهندسة المعمارية، وعمليات التدريب، ومعايير التقييم لكل إصدار. - عرض توضيحي قائم على Gradio ومستضاف على Hugging Face Spaces للاختبار التفاعلي. يوفر المشروع وثائق شاملة حول التدريب، وتقييم محسّنات الفيديو التلقائية (autoencoders)، ونشر النماذج، بهدف تبسيط تعقيدات توليد الفيديو لصناع المحتوى والباحثين.