প্রকল্প সম্পর্কে
স্টেবল বেসলাইনস৩ (SB3) পিটারচ দিয়ে তৈরি নির্ভরযোগ্য রিইনফোর্সমেন্ট লার্নিং (RL) অ্যালগরিদম ইমপ্লিমেন্টেশনের একটি সংগ্রহ সরবরাহ করে। এটি গবেষণা সম্প্রদায় এবং শিল্পের জন্য RL পদ্ধতিগুলো স্বয়ংক্রিয়ভাবে বাস্তবায়ন না করেই প্রতিলিপি, পরিমার্জন এবং তুলনা করার জন্য একটি স্থিতিশীল ভিত্তি হিসেবে কাজ করে।
প্রধান বৈশিষ্ট্যগুলোর মধ্যে রয়েছে:
- সাধারণ, sklearn-সদৃশ ইন্টারফেস সহ আধুনিকতম RL পদ্ধতির সমর্থন।
- কাস্টম এনভায়রনমেন্ট, কাস্টম পোলিসি এবং কাস্টম ক্যালব্যাকের সমর্থন।
- Dict অবজারভেশন স্পেস এবং টেনসরবোর্ড পর্যবেক্ষণের সাথে সামঞ্জস্য।
- উচ্চ কোড কভারেজ, টাইপ হিন্টস এবং PEP8 compliance।
- এক্সপেরিমেন্ট ট্র্যাকিংয়ের জন্য ওয়েটস অ্যান্ড বায়াস এবং মডেল শেয়ারিংয়ের জন্য হাগিং ফেসের সাথে ইন্টিগ্রেশন।
অ implement করা অ্যালগরিদমগুলোর মধ্যে রয়েছে A2C, ARS, DDPG, DQN, HER, PPO, SAC, TD3 এবং অন্যান্য। Recurrent PPO এবং TQC-এর মতো কিছু পরীক্ষামূলক ফিচার SB3-Contrib রেপোজিটরি থেকে পাওয়া যায়, mentre আরও উন্নত পারফর্ম্যান্সের জন্য একটি Jax-ভিত্তিক সংস্করণ (SBX) উপলব্ধ।
প্রজেক্টটি আরএল বেসলাইনস৩ জুঁও-এর সাথেও লিঙ্ক করা আছে, যা সাধারণ এনভায়রনমেন্টের জন্য ট্রেনিং, এজেন্ট মূল্যায়ন এবং হাইপারপ্যারামিটার টিউনিং-এর জন্য স্ক্রিপ্ট সরবরাহকারী একটি ট্রেনিং ফ্রেমওয়ার্ক।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.