منصوبے کے بارے میں
ری انفورس ایک ری انفورسمنٹ لرننگ فریم ورک ہے جو گیم سیمولیشن، ٹری سرچ، ایپی سوڈ آرکیسٹریشن، اور بیچ اسمبلی کو ایک متوازی Rust بیک اینڈ میں منظر عام پر لاتا ہے۔ Rust انجن اور صارف کے درمیان حد ایک inference callback ہے: یہ pooled NumPy مشاہدات وصول کرتا ہے اور ماڈل آؤٹ پٹ واپس کرتا ہے، جس سے نیٹ ورک آرکیٹیکچر، تربیتی فریم ورک، آپٹیمائزر، ری پلی بفر، ہارڈ ویئر پلے سمینٹ، اور ڈسٹری بیوٹڈ ٹوپولوجی سب صارف کے کنٹرول میں رہتے ہیں۔
لائبریری میں سنگل اور ملٹی ایجنٹ، زیرو سم، تعاون کارانہ، اور جنرل سم ٹاسک کے احاطے والی کھیلاوں کی وسیع فہرست شامل ہے، جس میں باری وار یا یکساں فیصلوں، صراحتی چانس واقعات، اور مملوک اور غیر مملوک معلومات دونوں کا سپورٹ ملتا ہے۔ الگورتھمز پالی سی ڈرائیون ولو لرننگ، سرچ گائیڈڈ لرننگ، اور اسٹینڈ البان گیم تھیوریٹک سلورنگ میتھڈز تک پھیلے ہوئے ہیں۔
تنصیب pip کے ذریعے `pip install reinfors` سے ہوتی ہے، Gymnasium/PettingZoo ایڈاپٹرز (`reinfors[gym]`) اور PyTorch تربیتی مثالوں (`reinfors[train]`) کے اختیاری ایکسٹرا کے ساتھ۔ ایک سادہ مثال Connect4 انجن بناتی ہے اور inference فنکشن فراہم کر کے تربیتی بیچ جمع کرتی ہے۔
بینچ مارکنگ pure Python RL لائبریری جیسے Gymnasium کے مقابلے میں قابل ذکر کارکردگی کے فوائد دکھاتی ہے، جہاں سنگل تھریڈڈ انوائرنمنٹ اسٹیپنگ پر تقریباً 14-20x کی رفتار کا اضافہ رپورٹ کیا گیا ہے۔ ری انفورس مقامی سیمولیشن کارکردگی اور کھیلاوں، الگورتھمز، نیٹ ورکس، اور تعیناتی کے تنظیموں میں وسیع تجربہ کاری کے لیے ماڈیولیری کے درمیان عملی توازن کا ہدف بھی رکھتا ہے۔
پروجیکٹ pre-1.0 ہے، جس کا مطلب ہے کہ APIs، رویے، اور serialized فارمیٹس deprecation warnings کے بغیر 0.x ریلیزز کے درمیان بدل سکتے ہیں۔ صارفین کو exact versions pin کرنے اور اپ گریڈ کرتے وقت release notes دیکھنے کا مشورہ دیا جاتا ہے۔ یہ MIT اور Apache-2.0 کے تحت dual-licensed ہے۔
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.