इस प्रोजेक्ट के बारे में

Stable Baselines3 (SB3) PyTorch के साथ बनाए गए विश्वसनीय रिइनफोर्समेंट लर्निंग (RL) एल्गोरिदम कार्यान्वयनों का संग्रह प्रदान करता है। यह शोध समुदाय और उद्योग के लिए RL दृष्टिकोणों को प्रतिपादन, परिष्कृत करने और तुलना करने के लिए एक स्थिर आधार के रूप में कार्य करता है, बिना एल्गोरिदम को शून्य से लागू करने की आवश्यकता के। मुख्य विशेषताएं: - साधारण, sklearn-समान इंटरफ़ेस के साथ आधुनिकतम RL विधियों का समर्थन। - कस्टम वातावरण, कस्टम नीतियों और कस्टम कॉलबैक का समर्थन। - Dict अवलोकन स्थान और निगरानी के लिए Tensorboard के साथ संगतता। - उच्च कोड कवरेज, प्रकार संकेत और PEP8 अनुपालन। - प्रयोग ट्रैकिंग के लिए Weights & Biases और मॉडल साझाकरण के लिए Hugging Face के साथ एकीकरण। लागू किए गए एल्गोरिदम में A2C, ARS, DDPG, DQN, HER, PPO, SAC, TD3 और अन्य शामिल हैं। कुछ प्रायोगिक विशेषताएं (जैसे Recurrent PPO और TQC) SB3-Contrib रिपॉज़िटरी के माध्यम से उपलब्ध हैं, जबकि बढ़ी हुई प्रदर्शन के लिए एक Jax-आधारित संस्करण (SBX) उपलब्ध है। परियोजना RL Baselines3 Zoo से भी जुड़ी हुई है, जो साधारण वातावरणों के लिए एजेंट्स को प्रशिक्षित, मूल्यांकन और अतिपरामिति अनुकूलन के लिए स्क्रिप्ट प्रदान करने वाला एक प्रशिक्षण फ्रेमवर्क है।