عن المشروع

LingBot-Map هو نموذج أساسي ثلاثي الأبعاد ذو تغذية أمامية مصمم لإعادة البناء التدفقية ثلاثية الأبعاد من تسلسلات الفيديو أو الصور. يقدّم محوّل السياق الهندسي (Geometric Context Transformer) الذي يوحّد ترسيخ الإحداثيات والإشارات الهندسية الكثيفة وتصحيح الانحراف بعيد المدى ضمن إطار تدفقي واحد باستخدام سياق المراسي ونوافذ مرجع الوضعية وذاكرة المسار. تتيح هذه البنية استدلالًا عالي الكفاءة بنحو 20 إطارًا في الثانية عند دقة 518x378 عبر تسلسلات تتجاوز 10,000 إطار، بالاستفادة من انتباه ذاكرة KV المؤقتة المصفّحة (يُوصى بـ FlashInfer، مع بديل SDPA). يوفر المستودع سيرتي عمل رئيسيتين: عرض توضيحي تفاعلي (demo.py) يستخدم عارض viser القائم على المتصفح للتصور في الوقت الفعلي، وخط أنابيب تصيير دون اتصال (demo_render/batch_demo.py) لإنتاج مقاطع MP4 بلا واجهة لتحليق الكاميرا عبر سحابة النقاط من مقاطع الفيديو الطويلة. يدعم كلاهما قناع السماء عبر نماذج تجزئة ONNX، واستراتيجيات فواصل الإطارات المفتاحية لإدارة ذاكرة KV المؤقتة، والاستدلال النافذي للتسلسلات التي تتجاوز نطاق التدريب البالغ نحو 320 إطارًا. نقاط التحقق المدربة مسبقًا متاحة على HuggingFace وModelScope، مع معايير تقييم لمجموعات بيانات مثل KITTI وOxford Spires. يتطلب التثبيت Python 3.10 وPyTorch 2.8.0 مع CUDA 12.8، وتبعيات اختيارية للتصيير (Open3D وKaolin وffmpeg) وللتصور. المشروع مرخّص بموجب رخصة Apache-2.0 ويتضمن وثائق مفصلة وأمثلة عملية (تجوال داخلي، قيادة خارجية، مشاهد مولّدة)، وخيارات لضبط الأداء عند محدودية ذاكرة GPU.