প্রকল্প সম্পর্কে

TorchRL হলো রিইনফোর্সমেন্ট লার্নিংয়ের জন্য একটি মডুলার, প্রিমিটিভ-ফার্স্ট, Python-ফার্স্ট PyTorch লাইব্রেরি। এটি একক অ্যালগরিদম বাস্তবায়নের বদলে RL সিস্টেমের জন্য কম্পোজেবল বিল্ডিং ব্লক সরবরাহ করে, যাতে কোড PyTorch প্রোগ্রামিং মডেলের কাছাকাছি থাকে। লাইব্রেরিটি TensorDict-কে কেন্দ্র করে সংগঠিত, যা একটি ডিকশনারির মতো টেনসর কনটেইনার, যা ট্রেনিং লুপ জুড়ে নামযুক্ত ফিল্ড, স্ট্রাকচার, ব্যাচ ডাইমেনশন এবং ডিভাইস সংরক্ষণ করে। মূল কম্পোনেন্টগুলোর মধ্যে রয়েছে এনভায়রনমেন্ট ও ট্রান্সফর্ম (Gymnasium, DM Control, Brax, PettingZoo, VMAS, Isaac Lab এবং অন্যান্যদের জন্য র্যাপারসহ), সিঙ্গেল-প্রসেস, অ্যাসিঙ্ক, মাল্টিপ্রসেস ও ডিস্ট্রিবিউটেড এক্সিকিউশনের জন্য কালেক্টর, প্রায়োরিটাইজড ও মেমম্যাপ-ব্যাকড স্টোরেজসহ রিপ্লে বাফার, স্পষ্ট ইনপুট/আউটপুট কীসহ পলিসি মডিউল, এবং PPO, SAC, DQN, TD3, REDQ, IQL, CQL, Decision Transformer, Dreamer, MAPPO, IPPO, QMIX/VDN এবং আরও অনেক কিছু কভার করা লস মডিউল। লাইব্রেরিটি মাল্টি-এজেন্ট, মডেল-ভিত্তিক, ইমিটেশন লার্নিং এবং GRPO ও SFT অবজেক্টিভসহ LLM পোস্ট-ট্রেনিং ওয়ার্কফ্লোও সমর্থন করে। TorchRL 0.13 Triton ও scan ব্যাকএন্ডসহ দ্রুততর রিকারেন্ট RL পাথ, কাস্টম MuJoCo এনভায়রনমেন্ট, মাল্টি-এজেন্ট ভ্যালু নরমালাইজেশন ইউটিলিটি, HER রিপ্লে বাফার এবং উন্নত কালেক্টর ও রিপ্লে-বাফার এর্গোনমিক্স যোগ করে। ইনস্টলেশন PyPI-এর মাধ্যমে পাওয়া যায়, Gymnasium, Atari, অফলাইন ডেটা, মাল্টি-এজেন্ট এনভায়রনমেন্ট এবং LLM ব্যাকএন্ডের জন্য ঐচ্ছিক এক্সট্রাসহ।