منصوبے کے بارے میں
سیبل بلائنز3 (SB3) پائیتارچ کے ساتھ بنائے گئے قابل اعتماد تقویتِ سیکھنے (RL) الگورتھم کے نفاذ کا ایک مجموعہ فراہم کرتا ہے۔ یہ تحقیقی برادری اور صنعت کو بغیر نو سے الگورتھم لکھے RL طریقوں کی نقل، بہتری اور موازنہ کرنے کا مستحکم بنیاد فراہم کرتا ہے۔
اہم خصوصیات میں شامل ہیں:
- ایک عام، sklearn جیسا انٹرفیس کے ساتھ جدید ترین RL طریقوں کا سپورٹ۔
- حسبِ ضرورت ماحولات، حسبِ ضرورت پالیسیاں، اور حسبِ ضرورت کیل بیکس کا سپورٹ۔
- Dict مشاہدہ خلا اور Tensorboard نگرانی کے ساتھ مطابقت۔
- اعلیٰ کوڈ کوریج، ٹائپ ہنٹس، اور PEP8 تعمیل۔
- تجربے کی ٹریکنگ کے لیے Weights & Biases اور ماڈل شیئرنگ کے لیے Hugging Face کے ساتھ انٹیग्रیشن۔
لاگو کردہ الگورتھم میں A2C, ARS, DDPG, DQN, HER, PPO, SAC, TD3 اور دیگر شامل ہیں۔ کچھ تجرباتی خصوصیات (جیسے Recurrent PPO اور TQC) SB3-Contrib ریپوزٹری کے ذریعے دستیاب ہیں، جبکہ بڑھی ہوئی کارکردگی کے لیے Jax پر مبنی ورژن (SBX) دستیاب ہے۔
پروجیکٹ RL Baselines3 Zoo سے بھی منسلک ہے، جو ایک تربیتی فریم ورک ہے جو عام ماحولات کے لیے تربیت، ایجنٹس کا جائزہ، اور ہیپر میٹرکس ٹوننگ کے اسکرپٹس فراہم کرتا ہے۔
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.