इस प्रोजेक्ट के बारे में
decisionrl एक रीइन्फोर्समेंट लर्निंग लाइब्रेरी है जो परिचालन निर्णय-निर्माण समस्याओं जैसे मूल्य निर्धारण, इन्वेंट्री प्रबंधन, ऊर्जा वितरण, कतार प्रवेश, और आपूर्ति श्रृंखला अनुकूलन के लिए विशेष रूप से बनाई गई है। सामान्य-उद्देश्य वाले RL फ्रेमवर्क के विपरीत जो गेम और रोबोटिक्स को लक्षित करते हैं, decisionrl प्रत्येक अनुप्रयुक्त समस्या को एक प्रथम-श्रेणी वातावरण के रूप में शामिल करता है, जिसमें शास्त्रीय संचालन-अनुसंधान बेसलाइन जोड़ी जाती है, ताकि एक सीखी गई नीति को मानक विधि के विरुद्ध मापा जा सके, न कि केवल अच्छा होने का दावा किया जा सके।
लाइब्रेरी 31 एल्गोरिदम प्रदान करती है जिसमें सारणीबद्ध विधियाँ (Q-Learning, SARSA, Expected SARSA, Dyna-Q), मूल्य-आधारित गहन RL (DQN, Rainbow, C51, QR-DQN), अभिनेता-आलोचक विधियाँ (PPO, A2C, TRPO, GRPO, IMPALA, Recurrent PPO), निरंतर नियंत्रण (DDPG, TD3, SAC, SACDiscrete), ऑफ़लाइन RL (TD3+BC, IQL, CQL, Decision Transformer), मॉडल-आधारित दृष्टिकोण (MBPO, Dreamer, DreamerRSSM), लक्ष्य-सशर्त शिक्षण (HER+DQN), और अनुकरण शिक्षण (Diffusion Policy) शामिल हैं। प्रत्येक एजेंट एक एकीकृत predict/learn/save/load इंटरफेस उजागर करता है, चाहे वह सारणीबद्ध हो या गहन, असतत हो या निरंतर, ऑन-पॉलिसी हो या ऑफ-पॉलिसी।
मुख्य भाग निर्भरता-हल्का है: वातावरण, शास्त्रीय बेसलाइन, और सॉल्वर शुद्ध NumPy हैं, जबकि PyTorch एक वैकल्पिक अतिरिक्त है जो केवल उन एल्गोरिदम के लिए आवश्यक है जो प्रशिक्षण लेते हैं। अंतर्निहित वातावरण में GridWorld, CartPole, Pendulum, PointMass, और bandits शामिल हैं, जो अतिरिक्त इंस्टॉल के बिना अंत-से-अंत प्रशिक्षण की अनुमति देते हैं। Gymnasium वातावरण एक वैकल्पिक अतिरिक्त के रूप में उपलब्ध हैं।
अनुप्रयुक्त वातावरण में बहती मांग के साथ गैर-स्थिर इन्वेंट्री, दो-स्तरीय आपूर्ति श्रृंखला, कतार प्रवेश नियंत्रण, ऊर्जा माइक्रोग्रिड बैटरी प्रबंधन, थर्मोस्टेट/HVAC नियंत्रण, स्थिर इन्वेंट्री, गतिशील मूल्य निर्धारण, और संयुक्त मूल्य निर्धारण प्लस इन्वेंट्री शामिल हैं। प्रत्येक में खोज द्वारा पाया गया सर्वश्रेष्ठ निश्चित-नियम शास्त्रीय बेसलाइन शामिल है, न कि एक भोला डिफ़ॉल्ट। परिणाम दिखाते हैं कि सीखी गई नीति गैर-स्थिर कार्यों पर शास्त्रीय बेसलाइन से बेहतर प्रदर्शन करती है (जैसे, बहती इन्वेंट्री पर लगभग 16% सुधार, ऊर्जा माइक्रोग्रिड पर 20%, आपूर्ति श्रृंखला लागत में 15% कमी) और स्थिर कार्यों पर सटीक गतिशील-प्रोग्रामिंग इष्टतम से मेल खाती है। एक केस स्टडी 1959 से 2009 तक त्रैमासिक अमेरिकी वास्तविक उपभोग डेटा के साथ इन्वेंट्री वातावरण को चलाती है, जो दिखाती है कि सीखी गई नीति सर्वश्रेष्ठ निश्चित बेस-स्टॉक में सुधार करती है क्योंकि वास्तविक मांग रुझान और कोई एकल ऑर्डर-अप-टू स्तर हर युग में फिट नहीं होता।
लाइब्रेरी में संदर्भित bandits (LinUCB, रैखिक थॉम्पसन नमूनाकरण, epsilon-greedy) भी शामिल हैं जो एक-शॉट निर्णय जैसे मूल्य निर्धारण और सिफारिश के लिए हैं, नियंत्रण कार्यों और एक वर्ण-स्तरीय GPT पर RLHF और DPO, अनुकरण शिक्षण (BC, DAgger, GAIL), जिज्ञासा-संचालित अन्वेषण (RND, ICM), ग्रेडिएंट-मुक्त अनुकूलन (12 विकास और झुंड विधियाँ ask/tell इंटरफेस के साथ प्लस एक NeuroevolutionAgent), दो-खिलाड़ी पूर्ण-जानकारी खेलों के लिए MCTS और स्व-खेल के साथ AlphaZero, कार्य वितरण में ऑनलाइन अनुकूलन के लिए मेटा-RL (RL²), IPPO के साथ मल्टी-एजेंट स्व-खेल, एक केंद्रीय V-trace शिक्षार्थी को खिलाने वाले वितरित IMPALA-शैली अभिनेता, और ONNX और TorchScript निर्यात एक torch-मुक्त FastAPI सेवा कंटेनर के साथ।
एक कमांड-लाइन इंटरफेस प्रशिक्षण, मूल्यांकन, और लाइव डैशबोर्ड विज़ुअलाइज़ेशन का समर्थन करता है। प्रयोग YAML या JSON में घोषित किए जा सकते हैं और decisionrl run या decisionrl.config.run के साथ चलाए जा सकते हैं। प्रतिलिपि योग्यता Python, NumPy, और PyTorch में seedable RNGs के माध्यम से सुनिश्चित की जाती है, जिसमें 400 से अधिक परीक्षणों का परीक्षण सूट घटक शुद्धता (spaces, buffers, sum-tree, schedules, GAE, normalization, save/load round-trips) और शिक्षण व्यवहार (सारणीबद्ध विधियाँ इष्टतम GridWorld नीति तक पहुँचती हैं; DQN और PPO CartPole सीखते हैं; SAC, TD3, और DDPG PointMass कार्य हल करते हैं) को कवर करता है। एक अनुसूचित CI कार्यप्रवाह रात में बहु-बीज अनुप्रयुक्त सत्यापन को फिर से चलाता है और विफल हो जाता है यदि कोई रिपोर्ट किया गया परिणाम अपने बेसलाइन से नीचे गिर जाता है।
परियोजना MIT लाइसेंस के तहत है और CleanRL, Stable-Baselines3, Tianshou, और Farama Foundation के Gymnasium इंटरफेस से डिज़ाइन प्रेरणा लेती है।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.