প্রকল্প সম্পর্কে
TRL (Transformers Reinforcement Learning) হলো ফাউন্ডেশন মডেলগুলোর পোস্ট-ট্রেনিংয়ের জন্য ডিজাইন করা একটি লাইব্রেরি। এটি বিভিন্ন ফাইন-টিউনিং এবং অ্যালাইনমেন্ট পদ্ধতি বাস্তবায়নের জন্য একগুচ্ছ ট্রেইনার প্রদান করে, যার মধ্যে রয়েছে:
- `SFTTrainer`-এর মাধ্যমে Supervised Fine-Tuning (SFT)
- `GRPOTrainer`-এর মাধ্যমে Group Relative Policy Optimization (GRPO)
- `DPOTrainer`-এর মাধ্যমে Direct Preference Optimization (DPO)
- `KTOTrainer`-এর মাধ্যমে Kahneman-Tversky Optimization (KTO)
- `RewardTrainer`-এর মাধ্যমে Reward model training
এই লাইব্রেরিটি Hugging Face ইকোসিস্টেমের সাথে সমন্বিত, যা মাল্টি-নোড ক্লাস্টারের স্কেলিংয়ের জন্য Accelerate (DDP, DeepSpeed এবং FSDP সমর্থন করে) এবং LoRA/QLoRA ও কোয়ান্টাইজেশনের মাধ্যমে দক্ষ প্রশিক্ষণের জন্য PEFT-কে ব্যবহার করে। এটি কার্নেল-লেভেল এক্সিলারেশনের জন্য Unsloth-এর সাথেও সমন্বিত।
ব্যবহারকারীরা পাইথন API অথবা কোড-মুক্ত ফাইন-টিউনিংয়ের জন্য কমান্ড লাইন ইন্টারফেস (CLI)-এর মাধ্যমে TRL-এর সাথে ইন্টারঅ্যাক্ট করতে পারেন। এই লাইব্রেরিতে দীর্ঘ কনটেক্সট সিকোয়েন্সে (১ মিলিয়ন টোকেনের বেশি) প্রশিক্ষণের জন্য নির্দেশিকাও অন্তর্ভুক্ত রয়েছে।