इस प्रोजेक्ट के बारे में
LeWorldModel (LeWM) लुकास मेस, क्वेंटिन ले लिडेक, डेमियन स्कियर, यान लेकुन और रैंडल बेलेस्ट्रिएरो द्वारा लिखित पेपर "LeWorldModel: Stable End-to-End Joint-Embedding Predictive Architecture from Pixels" के लिए आधिकारिक कोडबेस है। यह एक जॉइंट-एम्बेडिंग प्रेडिक्टिव आर्किटेक्चर (JEPA) लागू करता है, जो सार के अनुसार, केवल दो लॉस टर्म्स का उपयोग करके कच्चे पिक्सल से एंड-टू-एंड स्थिर रूप से प्रशिक्षित होता है: एक अगला-एम्बेडिंग भविष्यवाणी लॉस और एक नियमितीकरण जो गाऊसी-वितरित लेटेंट एम्बेडिंग लागू करता है। लेखकों का कहना है कि यह केवल मौजूदा एंड-टू-एंड विकल्प की तुलना में ट्यून करने योग्य लॉस हाइपरपैरामीटर को छह से घटाकर एक कर देता है, और मॉडल में लगभग 15M पैरामीटर हैं जो कुछ घंटों में एक GPU पर प्रशिक्षित हो सकते हैं।
रिपॉजिटरी दो बाहरी परियोजनाओं पर आधारित है: पर्यावरण प्रबंधन, योजना और मूल्यांकन के लिए stable-worldmodel, और प्रशिक्षण के लिए stable-pretraining। बताया गया लक्ष्य इस रिपॉजिटरी को इसके मूल योगदान, मॉडल आर्किटेक्चर और प्रशिक्षण उद्देश्य तक सीमित करना है, जो jepa.py में PyTorch मॉड्यूल के रूप में लागू है।
स्थापना Python 3.10 के साथ uv का उपयोग करती है और train और env एक्स्ट्रा के साथ stable-worldmodel स्थापित करती है। डेटासेट Hugging Face के माध्यम से HDF5 प्रारूप में वितरित किए जाते हैं और tar --zstd के साथ डीकंप्रेस किए जाते हैं; निकाले गए .h5 फ़ाइलें $STABLEWM_HOME (डिफ़ॉल्ट ~/.stable-wm/) के अंतर्गत रखी जाती हैं, जिसे पर्यावरण चर के साथ ओवरराइड किया जा सकता है। डेटासेट नाम config/train/ के अंतर्गत Hydra कॉन्फ़िग फ़ाइलों में .h5 एक्सटेंशन के बिना संदर्भित किए जाते हैं।
प्रशिक्षण config/train/lewm.yaml में WandB इकाई और परियोजना सेट करने के बाद python train.py data=pusht के साथ लॉन्च किया जाता है। चेकपॉइंट पूरा होने पर $STABLEWM_HOME में सहेजे जाते हैं। मूल्यांकन कॉन्फ़िग config/eval/ के अंतर्गत रहते हैं, और policy फ़ील्ड को $STABLEWM_HOME के सापेक्ष चेकपॉइंट पथ की ओर इंगित करना चाहिए, बिना _object.ckpt सफ़िक्स के।
पूर्व-प्रशिक्षित LeWM चेकपॉइंट pusht, cube, tworooms और reacher वातावरण के लिए Hugging Face Hub पर मिरर किए गए हैं, साथ ही उसी संग्रह में डेटासेट भी हैं। एक व्यापक बेसलाइन चेकपॉइंट सूट (PLDM, LeJEPA, IVL, IQL, GCBC, DINO-WM, DINO-WM-noprop) Google Drive के माध्यम से उपलब्ध है, जिसमें एक तालिका दर्शाती है कि कौन से तरीके किन वातावरणों को कवर करते हैं। चेकपॉइंट दो रूपों में आते हैं: एक _object.ckpt क्रमबद्ध Python ऑब्जेक्ट जो eval.py और stable_worldmodel API द्वारा उपयोग किया जाता है, और एक _weight.ckpt केवल-वेट स्टेट डिक्ट। लोडिंग swm.policy.AutoCostModel के माध्यम से $STABLEWM_HOME के सापेक्ष रन नाम के साथ की जाती है; लौटाया गया मॉड्यूल eval मोड में है और .state_dict() उजागर करता है। Hugging Face मिरर के लिए, README एक रूपांतरण स्क्रिप्ट प्रदान करता है जो config.json और weights.pt से JEPA मॉडल का पुनर्निर्माण करता है और एक ऑब्जेक्ट चेकपॉइंट सहेजता है।
README पेपर, एक परियोजना वेबसाइट और Hugging Face संग्रह से भी लिंक करता है, और ईमेल के माध्यम से मुद्दों और सहयोग को आमंत्रित करता है। यह रिपोर्ट करता है कि LeWM फाउंडेशन-मॉडल-आधारित विश्व मॉडल की तुलना में 48x तेज योजना बनाता है, जबकि विविध 2D और 3D नियंत्रण कार्यों में प्रतिस्पर्धी बना रहता है, कि इसका लेटेंट स्थान भौतिक संरचना को एन्कोड करता है जैसा कि भौतिक मात्राओं की जांच से दिखाया गया है, और आश्चर्य मूल्यांकन भौतिक रूप से असंभव घटनाओं का पता लगाता है। ये लेखकों के सार के दावे हैं, यहां स्वतंत्र रूप से सत्यापित नहीं हैं।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.