প্রকল্প সম্পর্কে

LeWorldModel (LeWM) হল "LeWorldModel: Stable End-to-End Joint-Embedding Predictive Architecture from Pixels" শীর্ষক গবেষণাপত্রের অফিসিয়াল কোডবেস, যার লেখকরা হলেন Lucas Maes, Quentin Le Lidec, Damien Scieur, Yann LeCun এবং Randall Balestriero। এটি একটি জয়েন্ট-এমবেডিং প্রেডিক্টিভ আর্কিটেকচার (JEPA) প্রয়োগ করে যা, বিমূর্ত অনুসারে, শুধুমাত্র দুটি লস টার্ম ব্যবহার করে কাঁচা পিক্সেল থেকে স্থিরভাবে এন্ড-টু-এন্ড প্রশিক্ষণ দেয়: একটি পরবর্তী-এমবেডিং পূর্বাভাস লস এবং একটি নিয়মিতকরণ যা গাউসিয়ান-বিতরণকৃত ল্যাটেন্ট এমবেডিং প্রয়োগ করে। লেখকরা বলেছেন যে এটি বিদ্যমান একমাত্র এন্ড-টু-এন্ড বিকল্পের তুলনায় টিউনযোগ্য লস হাইপারপ্যারামিটার ছয় থেকে একটিতে হ্রাস করে এবং মডেলটির প্রায় 15M প্যারামিটার রয়েছে যা একটি একক GPU-তে কয়েক ঘন্টার মধ্যে প্রশিক্ষণযোগ্য। রিপোজিটরিটি দুটি বাহ্যিক প্রকল্পের উপর নির্মিত: পরিবেশ ব্যবস্থাপনা, পরিকল্পনা এবং মূল্যায়নের জন্য stable-worldmodel এবং প্রশিক্ষণের জন্য stable-pretraining। বিবৃত লক্ষ্য হল এই রিপোজিটরিটিকে এর মূল অবদানে হ্রাস করা, মডেল আর্কিটেকচার এবং প্রশিক্ষণের উদ্দেশ্য, যা jepa.py-তে একটি PyTorch মডিউল হিসাবে প্রয়োগ করা হয়েছে। ইনস্টলেশন Python 3.10 সহ uv ব্যবহার করে এবং train এবং env extras সহ stable-worldmodel ইনস্টল করে। ডেটাসেটগুলি Hugging Face এর মাধ্যমে HDF5 ফরম্যাটে বিতরণ করা হয় এবং tar --zstd দিয়ে ডিকম্প্রেস করা হয়; নিষ্কাশিত .h5 ফাইলগুলি $STABLEWM_HOME (ডিফল্ট ~/.stable-wm/) এর অধীনে স্থাপন করা হয়, যা একটি পরিবেশ পরিবর্তনশীল দিয়ে ওভাররাইড করা যেতে পারে। ডেটাসেট নামগুলি config/train/ এর অধীনে Hydra কনফিগার ফাইলগুলিতে .h5 এক্সটেনশন ছাড়া উল্লেখ করা হয়। config/train/lewm.yaml-এ WandB সত্তা এবং প্রকল্প সেট করার পরে python train.py data=pusht দিয়ে প্রশিক্ষণ চালু করা হয়। চেকপয়েন্টগুলি সম্পূর্ণ হলে $STABLEWM_HOME-এ সংরক্ষণ করা হয়। মূল্যায়ন কনফিগারেশন config/eval/ এর অধীনে থাকে এবং policy ক্ষেত্রটি অবশ্যই $STABLEWM_HOME এর সাথে সম্পর্কিত একটি চেকপয়েন্ট পাথ নির্দেশ করবে _object.ckpt প্রত্যয় ছাড়া। প্রাক-প্রশিক্ষিত LeWM চেকপয়েন্টগুলি pusht, cube, tworooms এবং reacher পরিবেশের জন্য Hugging Face Hub-এ মিরর করা হয়েছে, একই সংগ্রহে ডেটাসেট সহ। একটি বিস্তৃত বেসলাইন চেকপয়েন্ট স্যুট (PLDM, LeJEPA, IVL, IQL, GCBC, DINO-WM, DINO-WM-noprop) Google Drive এর মাধ্যমে উপলব্ধ, একটি টেবিল সহ যা নির্দেশ করে কোন পদ্ধতিগুলি কোন পরিবেশ কভার করে। চেকপয়েন্ট দুটি আকারে আসে: একটি _object.ckpt সিরিয়ালাইজড Python অবজেক্ট যা eval.py এবং stable_worldmodel API দ্বারা ব্যবহৃত হয় এবং একটি _weight.ckpt শুধুমাত্র ওজন-ভিত্তিক স্টেট ডিক্ট। লোডিং swm.policy.AutoCostModel এর মাধ্যমে $STABLEWM_HOME এর সাথে সম্পর্কিত একটি রান নাম দিয়ে করা হয়; ফেরত দেওয়া মডিউলটি eval মোডে থাকে এবং .state_dict() প্রকাশ করে। Hugging Face মিররগুলির জন্য, README একটি রূপান্তর স্ক্রিপ্ট সরবরাহ করে যা config.json এবং weights.pt থেকে JEPA মডেল পুনর্নির্মাণ করে এবং একটি অবজেক্ট চেকপয়েন্ট সংরক্ষণ করে। README এছাড়াও কাগজ, একটি প্রকল্প ওয়েবসাইট এবং Hugging Face সংগ্রহ লিঙ্ক করে এবং ইমেলের মাধ্যমে সমস্যা এবং সহযোগিতার আমন্ত্রণ জানায়। এটি রিপোর্ট করে যে LeWM ফাউন্ডেশন-মডেল-ভিত্তিক বিশ্ব মডেলগুলির তুলনায় 48x পর্যন্ত দ্রুত পরিকল্পনা করে যখন বিভিন্ন 2D এবং 3D নিয়ন্ত্রণ কাজ জুড়ে প্রতিযোগিতামূলক থাকে, এর ল্যাটেন্ট স্পেস শারীরিক কাঠামো এনকোড করে যেমন শারীরিক পরিমাণ প্রোবিং দ্বারা দেখানো হয়েছে, এবং বিস্ময় মূল্যায়ন শারীরিকভাবে অসম্ভব ঘটনা সনাক্ত করে। এগুলি লেখকদের বিমূর্ত থেকে দাবি, এখানে স্বাধীনভাবে যাচাই করা হয়নি।