منصوبے کے بارے میں
TorchRL ایک ماڈیولر، primitive-first، Python-first PyTorch لائبریری ہے جو reinforcement learning کے لیے ہے۔ یہ RL سسٹمز کے لیے قابلِ ترکیب بلڈنگ بلاکس فراہم کرتی ہے، نہ کہ کسی واحد الگورتھم کا نفاذ، اور کوڈ کو PyTorch پروگرامنگ ماڈل کے قریب رکھتی ہے۔ لائبریری TensorDict کے گرد منظم ہے، جو ایک ڈکشنری نما ٹینسر کنٹینر ہے جو تربیتی لوپ کے دوران نامزد فیلڈز، ساخت، batch dimensions اور devices کو محفوظ رکھتا ہے۔
اہم اجزاء میں environments اور transforms (Gymnasium، DM Control، Brax، PettingZoo، VMAS، Isaac Lab اور دیگر کے لیے wrappers کے ساتھ)، single-process، async، multiprocess اور distributed execution کے لیے collectors، prioritized اور memmap-backed storage والے replay buffers، واضح input/output keys والے policy modules، اور loss modules شامل ہیں جو PPO، SAC، DQN، TD3، REDQ، IQL، CQL، Decision Transformer، Dreamer، MAPPO، IPPO، QMIX/VDN اور مزید کا احاطہ کرتے ہیں۔ لائبریری multi-agent، model-based، imitation learning اور LLM post-training workflows کو بھی سپورٹ کرتی ہے، جن میں GRPO اور SFT objectives شامل ہیں۔
TorchRL 0.13 میں Triton اور scan backends کے ساتھ تیز تر recurrent RL paths، custom MuJoCo environments، multi-agent value normalization utilities، HER replay buffers، اور بہتر collector اور replay-buffer ergonomics شامل کیے گئے ہیں۔ Installation PyPI کے ذریعے دستیاب ہے، Gymnasium، Atari، offline data، multi-agent environments اور LLM backends کے لیے اختیاری extras کے ساتھ۔
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.