इस प्रोजेक्ट के बारे में
TorchRL रीइन्फोर्समेंट लर्निंग के लिए एक मॉड्यूलर, प्रिमिटिव-फर्स्ट, Python-फर्स्ट PyTorch लाइब्रेरी है। यह एकल एल्गोरिदम कार्यान्वयन के बजाय RL सिस्टम के लिए संयोजनीय बिल्डिंग ब्लॉक्स प्रदान करती है, और कोड को PyTorch प्रोग्रामिंग मॉडल के करीब रखती है। लाइब्रेरी TensorDict के आसपास संगठित है, जो एक डिक्शनरी-जैसा टेंसर कंटेनर है जो पूरे ट्रेनिंग लूप में नामित फ़ील्ड, संरचना, बैच डाइमेंशन और डिवाइस को सुरक्षित रखता है।
मुख्य घटकों में एनवायरनमेंट और ट्रांसफ़ॉर्म (Gymnasium, DM Control, Brax, PettingZoo, VMAS, Isaac Lab और अन्य के लिए रैपर सहित), सिंगल-प्रोसेस, एसिंक, मल्टीप्रोसेस और डिस्ट्रिब्यूटेड निष्पादन के लिए कलेक्टर, प्रायोरिटाइज़्ड और मेममैप-बैक्ड स्टोरेज वाले रीप्ले बफ़र, स्पष्ट इनपुट/आउटपुट कुंजियों वाले पॉलिसी मॉड्यूल, और PPO, SAC, DQN, TD3, REDQ, IQL, CQL, Decision Transformer, Dreamer, MAPPO, IPPO, QMIX/VDN और अन्य को कवर करने वाले लॉस मॉड्यूल शामिल हैं। लाइब्रेरी मल्टी-एजेंट, मॉडल-आधारित, इमिटेशन लर्निंग और GRPO तथा SFT उद्देश्यों सहित LLM पोस्ट-ट्रेनिंग वर्कफ़्लो का भी समर्थन करती है।
TorchRL 0.13 में Triton और scan बैकएंड के साथ तेज़ रीकरंट RL पाथ, कस्टम MuJoCo एनवायरनमेंट, मल्टी-एजेंट वैल्यू नॉर्मलाइज़ेशन यूटिलिटीज़, HER रीप्ले बफ़र, और बेहतर कलेक्टर तथा रीप्ले-बफ़र एर्गोनॉमिक्स जोड़े गए हैं। इंस्टॉलेशन PyPI के माध्यम से उपलब्ध है, साथ में Gymnasium, Atari, ऑफ़लाइन डेटा, मल्टी-एजेंट एनवायरनमेंट और LLM बैकएंड के लिए वैकल्पिक एक्स्ट्रा भी।
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.