इस प्रोजेक्ट के बारे में

TorchRL रीइन्फोर्समेंट लर्निंग के लिए एक मॉड्यूलर, प्रिमिटिव-फर्स्ट, Python-फर्स्ट PyTorch लाइब्रेरी है। यह एकल एल्गोरिदम कार्यान्वयन के बजाय RL सिस्टम के लिए संयोजनीय बिल्डिंग ब्लॉक्स प्रदान करती है, और कोड को PyTorch प्रोग्रामिंग मॉडल के करीब रखती है। लाइब्रेरी TensorDict के आसपास संगठित है, जो एक डिक्शनरी-जैसा टेंसर कंटेनर है जो पूरे ट्रेनिंग लूप में नामित फ़ील्ड, संरचना, बैच डाइमेंशन और डिवाइस को सुरक्षित रखता है। मुख्य घटकों में एनवायरनमेंट और ट्रांसफ़ॉर्म (Gymnasium, DM Control, Brax, PettingZoo, VMAS, Isaac Lab और अन्य के लिए रैपर सहित), सिंगल-प्रोसेस, एसिंक, मल्टीप्रोसेस और डिस्ट्रिब्यूटेड निष्पादन के लिए कलेक्टर, प्रायोरिटाइज़्ड और मेममैप-बैक्ड स्टोरेज वाले रीप्ले बफ़र, स्पष्ट इनपुट/आउटपुट कुंजियों वाले पॉलिसी मॉड्यूल, और PPO, SAC, DQN, TD3, REDQ, IQL, CQL, Decision Transformer, Dreamer, MAPPO, IPPO, QMIX/VDN और अन्य को कवर करने वाले लॉस मॉड्यूल शामिल हैं। लाइब्रेरी मल्टी-एजेंट, मॉडल-आधारित, इमिटेशन लर्निंग और GRPO तथा SFT उद्देश्यों सहित LLM पोस्ट-ट्रेनिंग वर्कफ़्लो का भी समर्थन करती है। TorchRL 0.13 में Triton और scan बैकएंड के साथ तेज़ रीकरंट RL पाथ, कस्टम MuJoCo एनवायरनमेंट, मल्टी-एजेंट वैल्यू नॉर्मलाइज़ेशन यूटिलिटीज़, HER रीप्ले बफ़र, और बेहतर कलेक्टर तथा रीप्ले-बफ़र एर्गोनॉमिक्स जोड़े गए हैं। इंस्टॉलेशन PyPI के माध्यम से उपलब्ध है, साथ में Gymnasium, Atari, ऑफ़लाइन डेटा, मल्टी-एजेंट एनवायरनमेंट और LLM बैकएंड के लिए वैकल्पिक एक्स्ट्रा भी।