منصوبے کے بارے میں

TRL (Transformers Reinforcement Learning) ایک ایسی لائبریری ہے جسے فاؤنڈیشن ماڈلز کی پوسٹ ٹریننگ کے لیے ڈیزائن کیا گیا ہے۔ یہ مختلف فائن ٹیوننگ اور الائنمنٹ طریقوں کو نافذ کرنے کے لیے ٹرینرز کا ایک مجموعہ فراہم کرتی ہے، بشمول: - `SFTTrainer` کے ذریعے Supervised Fine-Tuning (SFT) - `GRPOTrainer` کے ذریعے Group Relative Policy Optimization (GRPO) - `DPOTrainer` کے ذریعے Direct Preference Optimization (DPO) - `KTOTrainer` کے ذریعے Kahneman-Tversky Optimization (KTO) - `RewardTrainer` کے ذریعے Reward model training یہ لائبریری Hugging Face ایکو سسٹم کے ساتھ مربوط ہے، جو ملٹی نوڈ کلسٹرز پر اسکیلنگ کے لیے Accelerate (DDP، DeepSpeed، اور FSDP کی سپورٹ کے ساتھ) اور LoRA/QLoRA اور کوانٹائزیشن کے ذریعے موثر ٹریننگ کے لیے PEFT کا استعمال کرتی ہے۔ یہ کرنل لیول ایکسلریشن کے لیے Unsloth کے ساتھ بھی مربوط ہے۔ صارفین Python API یا کوڈ کے بغیر فائن ٹیوننگ کے لیے Command Line Interface (CLI) کے ذریعے TRL کے ساتھ تعامل کر سکتے ہیں۔ لائبریری میں طویل سیاق و سباق کی ترتیب (1M ٹوکنز سے زیادہ) پر ٹریننگ کے لیے گائیڈز بھی شامل ہیں۔