প্রকল্প সম্পর্কে

LingBot-Map একটি ফিড-ফরোয়ার্ড 3D ফাউন্ডেশন মডেল যা ভিডিও বা ইমেজ সিকোয়েন্স থেকে স্ট্রিমিং 3D পুনর্গঠনের জন্য ডিজাইন করা হয়েছে। এটি একটি জিওমেট্রিক কনটেক্সট ট্রান্সফরমার (Geometric Context Transformer) প্রবর্তন করে যা একটি একক স্ট্রিমিং ফ্রেমওয়ার্কের মধ্যে অ্যাঙ্কর কনটেক্সট, পোজ-রেফারেন্স উইন্ডো এবং ট্রাজেক্টোরি মেমোরি ব্যবহার করে কোঅর্ডিনেট গ্রাউন্ডিং, ঘন জ্যামিতিক সংকেত এবং দীর্ঘ-পরিসরের ড্রিফট সংশোধনকে একীভূত করে। আর্কিটেকচারটি 518x378 রেজোলিউশনে প্রায় 20 FPS-এ 10,000 ফ্রেমের বেশি সিকোয়েন্সের উপর উচ্চ-দক্ষতা ইনফারেন্স সক্ষম করে, পেজড KV ক্যাশ অ্যাটেনশন (FlashInfer প্রস্তাবিত, SDPA ফলব্যাক সহ) ব্যবহার করে। রিপোজিটরিটি দুটি প্রধান ওয়ার্কফ্লো সরবরাহ করে: একটি ইন্টারেক্টিভ ডেমো (`demo.py`) যা রিয়েল-টাইম ভিজুয়ালাইজেশনের জন্য ব্রাউজার-ভিত্তিক ভাইজার ভিউয়ার ব্যবহার করে এবং একটি অফলাইন রেন্ডারিং পাইপলাইন (`demo_render/batch_demo.py`) যা দীর্ঘ ভিডিও থেকে হেডলেস পয়েন্ট-ক্লাউড ফ্লাইথ্রু MP4 তৈরি করে। উভয়ই ONNX সেগমেন্টেশন মডেলের মাধ্যমে স্কাই মাস্কিং, KV ক্যাশ মেমোরি পরিচালনার জন্য কীফ্রেম ইন্টারভাল কৌশল এবং ~320-ফ্রেম প্রশিক্ষণ সীমার বাইরের সিকোয়েন্সের জন্য উইন্ডোড ইনফারেন্স সমর্থন করে। প্রি-ট্রেইনড চেকপয়েন্টগুলি HuggingFace এবং ModelScope-এ উপলব্ধ, যার মধ্যে KITTI এবং Oxford Spires-এর মতো ডেটাসেটের জন্য মূল্যায়ন বেঞ্চমার্ক অন্তর্ভুক্ত রয়েছে। ইনস্টলেশনের জন্য Python 3.10, PyTorch 2.8.0 CUDA 12.8 সহ এবং রেন্ডারিং (Open3D, Kaolin, ffmpeg) ও ভিজুয়ালাইজেশনের জন্য ঐচ্ছিক নির্ভরতা প্রয়োজন। প্রকল্পটি Apache-2.0 লাইসেন্সের অধীনে লাইসেন্সকৃত এবং এতে বিস্তারিত ডকুমেন্টেশন, কাজের উদাহরণ (ইনডোর ওয়াকথ্রু, আউটডোর ড্রাইভ, জেনারেটেড দৃশ্য) এবং সীমিত GPU মেমোরির জন্য পারফরম্যান্স টিউনিং অপশন অন্তর্ভুক্ত রয়েছে।