প্রকল্প সম্পর্কে
decisionrl হলো একটি রিইনফোর্সমেন্ট লার্নিং লাইব্রেরি যা মূল্য নির্ধারণ, ইনভেন্টরি ম্যানেজমেন্ট, শক্তি বিতরণ, কিউ ভর্তি এবং সাপ্লাই চেইন অপ্টিমাইজেশনের মতো অপারেশনাল সিদ্ধান্ত গ্রহণের সমস্যার জন্য বিশেষভাবে নির্মিত। গেম এবং রোবোটিক্সকে লক্ষ্য করে তৈরি সাধারণ-উদ্দেশ্যের RL ফ্রেমওয়ার্কগুলির বিপরীতে, decisionrl প্রতিটি প্রয়োগকৃত সমস্যাকে একটি প্রথম-শ্রেণীর পরিবেশ হিসেবে সরবরাহ করে যার সাথে ক্লাসিক্যাল অপারেশনস-রিসার্চ বেসলাইন থাকে, যাতে একটি শেখা নীতি মানক পদ্ধতির বিরুদ্ধে পরিমাপ করা যায়, ভালো বলে দাবি করার পরিবর্তে।
লাইব্রেরিটি ৩১টি অ্যালগরিদম সরবরাহ করে যার মধ্যে রয়েছে ট্যাবুলার পদ্ধতি (Q-Learning, SARSA, Expected SARSA, Dyna-Q), মান-ভিত্তিক ডিপ RL (DQN, Rainbow, C51, QR-DQN), অ্যাক্টর-ক্রিটিক পদ্ধতি (PPO, A2C, TRPO, GRPO, IMPALA, Recurrent PPO), ক্রমাগত নিয়ন্ত্রণ (DDPG, TD3, SAC, SACDiscrete), অফলাইন RL (TD3+BC, IQL, CQL, Decision Transformer), মডেল-ভিত্তিক পদ্ধতি (MBPO, Dreamer, DreamerRSSM), লক্ষ্য-শর্তযুক্ত শিক্ষা (HER+DQN), এবং অনুকরণ শিক্ষা (Diffusion Policy)। প্রতিটি এজেন্ট একটি ইউনিফাইড predict/learn/save/load ইন্টারফেস প্রকাশ করে, তা ট্যাবুলার বা ডিপ, বিচ্ছিন্ন বা ক্রমাগত, অন-পলিসি বা অফ-পলিসি যাই হোক না কেন।
মূল অংশটি নির্ভরতা-হালকা: পরিবেশ, ক্লাসিক্যাল বেসলাইন এবং সমাধানকারী সম্পূর্ণ NumPy-তে, যখন PyTorch একটি ঐচ্ছিক অতিরিক্ত যা শুধুমাত্র প্রশিক্ষণ দেয় এমন অ্যালগরিদমগুলির প্রয়োজন। অন্তর্নির্মিত পরিবেশগুলির মধ্যে রয়েছে GridWorld, CartPole, Pendulum, PointMass এবং bandits, যা অতিরিক্ত ইনস্টল ছাড়াই শেষ-থেকে-শেষ প্রশিক্ষণের অনুমতি দেয়। Gymnasium পরিবেশ একটি ঐচ্ছিক অতিরিক্ত হিসাবে উপলব্ধ।
প্রয়োগকৃত পরিবেশগুলির মধ্যে রয়েছে অ-স্থির ইনভেন্টরি যার সাথে প্রবাহিত চাহিদা, দুই-স্তরের সাপ্লাই চেইন, কিউ ভর্তি নিয়ন্ত্রণ, শক্তি মাইক্রোগ্রিড ব্যাটারি ব্যবস্থাপনা, থার্মোস্ট্যাট/HVAC নিয়ন্ত্রণ, স্থির ইনভেন্টরি, গতিশীল মূল্য নির্ধারণ এবং যৌথ মূল্য প্লাস ইনভেন্টরি। প্রতিটিতে অনুসন্ধানের মাধ্যমে পাওয়া সেরা নির্দিষ্ট-নিয়ম ক্লাসিক্যাল বেসলাইন অন্তর্ভুক্ত থাকে, একটি নিষ্পাপ ডিফল্ট নয়। ফলাফল দেখায় যে শেখা নীতিটি অ-স্থির কাজগুলিতে ক্লাসিক্যাল বেসলাইনকে ছাড়িয়ে যায় (যেমন, প্রবাহিত ইনভেন্টরিতে প্রায় ১৬% উন্নতি, শক্তি মাইক্রোগ্রিডে ২০%, সাপ্লাই চেইন খরচ হ্রাসে ১৫%) এবং স্থির কাজগুলিতে সঠিক ডায়নামিক-প্রোগ্রামিং সর্বোত্তমতার সাথে মেলে। একটি কেস স্টাডি ১৯৫৯ থেকে ২০০৯ সাল পর্যন্ত ত্রৈমাসিক মার্কিন প্রকৃত ভোগ ডেটা দিয়ে ইনভেন্টরি পরিবেশ চালায়, যা দেখায় যে শেখা নীতিটি সেরা নির্দিষ্ট বেস-স্টকের উন্নতি করে কারণ প্রকৃত চাহিদার প্রবণতা রয়েছে এবং কোনো একক অর্ডার-আপ-টু স্তর প্রতিটি যুগের সাথে খাপ খায় না।
লাইব্রেরিতে আরও অন্তর্ভুক্ত রয়েছে প্রাসঙ্গিক ব্যান্ডিট (LinUCB, লিনিয়ার থম্পসন স্যাম্পলিং, epsilon-greedy) এক-শট সিদ্ধান্ত যেমন মূল্য নির্ধারণ এবং সুপারিশের জন্য, নিয়ন্ত্রণ কাজ এবং একটি অক্ষর-স্তরের GPT-তে RLHF এবং DPO, অনুকরণ শিক্ষা (BC, DAgger, GAIL), কৌতূহল-চালিত অনুসন্ধান (RND, ICM), গ্রেডিয়েন্ট-মুক্ত অপ্টিমাইজেশন (একটি ask/tell ইন্টারফেস সহ ১২টি বিবর্তন এবং ঝাঁক পদ্ধতি প্লাস একটি NeuroevolutionAgent), AlphaZero MCTS এবং দুই-খেলোয়াড়ের নিখুঁত-তথ্য গেমের জন্য স্ব-খেলা সহ, মেটা-RL (RL²) একটি কাজের বিতরণ জুড়ে অনলাইন অভিযোজনের জন্য, IPPO সহ মাল্টি-এজেন্ট স্ব-খেলা, একটি কেন্দ্রীয় V-trace লার্নারকে খাওয়ানো বিতরণকৃত IMPALA-স্টাইল অভিনেতা, এবং একটি torch-মুক্ত FastAPI সার্ভিং কন্টেইনার সহ ONNX এবং TorchScript রপ্তানি।
একটি কমান্ড-লাইন ইন্টারফেস প্রশিক্ষণ, মূল্যায়ন এবং লাইভ ড্যাশবোর্ড ভিজ্যুয়ালাইজেশন সমর্থন করে। পরীক্ষাগুলি YAML বা JSON-এ ঘোষণা করা যেতে পারে এবং decisionrl run বা decisionrl.config.run দিয়ে চালানো যেতে পারে। Python, NumPy এবং PyTorch জুড়ে seedable RNG-এর মাধ্যমে পুনরুৎপাদনযোগ্যতা নিশ্চিত করা হয়, ৪০০-এরও বেশি পরীক্ষার একটি পরীক্ষা স্যুট সহ যা উপাদান সঠিকতা (স্পেস, বাফার, sum-tree, সময়সূচী, GAE, স্বাভাবিককরণ, save/load রাউন্ড-ট্রিপ) এবং শেখার আচরণ (ট্যাবুলার পদ্ধতিগুলি সর্বোত্তম GridWorld নীতিতে পৌঁছায়; DQN এবং PPO CartPole শেখে; SAC, TD3 এবং DDPG PointMass কাজটি সমাধান করে) কভার করে। একটি নির্ধারিত CI ওয়ার্কফ্লো প্রতি রাতে মাল্টি-সিড প্রয়োগকৃত যাচাইকরণ পুনরায় চালায় এবং কোনো রিপোর্ট করা ফলাফল তার বেসলাইনের নিচে ফিরে গেলে ব্যর্থ হয়।
প্রকল্পটি MIT লাইসেন্সের অধীনে এবং CleanRL, Stable-Baselines3, Tianshou এবং Farama Foundation-এর Gymnasium ইন্টারফেস থেকে ডিজাইন অনুপ্রেরণা গ্রহণ করে।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.