عن المشروع
LingBot-World هو إطار عمل مفتوح المصدر لمحاكاة العالم وتوليد الفيديو مبني على بنية Wan2.2. صُمم لتطوير نماذج العالم مفتوحة المصدر من خلال تقديم محاكاة عالية الدقة، وديناميكيات قوية عبر أنماط بصرية متنوعة (مثل الواقعية والسياقات العلمية والرسوم المتحركة)، واتساق ذاكرة طويل المدى على مدى آفاق دقيقة. يدعم النموذج التفاعل في الوقت الفعلي، محققًا زمن استجابة منخفض (أقل من ثانية واحدة) بمعدل 16 إطارًا في الثانية.
الميزات الرئيسية:
- **بيئات عالية الدقة ومتنوعة**: قادر على محاكاة بيئات معقدة عبر مجالات بصرية متعددة.
- **ذاكرة طويلة المدى واتساق**: يحافظ على الاتساق السياقي عبر آفاق فيديو طويلة.
- **تفاعل في الوقت الفعلي**: يدعم التحكم التفاعلي بزمن استجابة منخفض، مناسب للألعاب وإنشاء المحتوى وتعلم الروبوتات.
- **إشارات تحكم مرنة**: يمكن توجيهه بواسطة أوضاع الكاميرا أو تسلسلات الأفعال أو سلاسل أفعال سهلة الاستخدام (مثل أوامر الحركة واتجاه الكاميرا)، أو تشغيله بدون شروط.
النماذج والأدوات:
- **LingBot-World-Base (Cam)**: نموذج متحكم به بوضع الكاميرا متوفر بدقة 480P و720P.
- **LingBot-World-Base (Act)**: نموذج متحكم به بالأفعال يدعم سلاسل أفعال نصية.
- **LingBot-World-Fast**: نسخة مسرعة تستخدم الاستدلال السببي وتخزين KV لتوليد إطارات فعال على دفعات.
- **النموذج الكمي**: نسخة كمية 4 بت متاحة للمستخدمين ذوي ذاكرة GPU محدودة، لكنها للاستدلال فقط وقد تظهر تدهورًا بصريًا طفيفًا.
المتطلبات التقنية والاستخدام:
يتطلب المشروع PyTorch (>= 2.4.0) وflash attention. تدعم نصوص الاستدلال التنفيذ متعدد وحدات GPU عبر `torchrun`. يمكن تنزيل أوزان النماذج من HuggingFace أو ModelScope. يوفر المستودع نصوصًا أمثلة لتوليد فيديو من صورة مع خيارات تكوين متنوعة.
ملاحظة: لم يعد هذا المستودع مُدارًا بنشاط. انتقل المؤلفون إلى المستودع الأحدث، LingBot-World-Infinity (v2).
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.