عن المشروع

TRL (Transformers Reinforcement Learning) هي مكتبة مصممة لعمليات ما بعد التدريب للنماذج الأساسية. وهي توفر مجموعة من المدربين لتنفيذ طرق مختلفة للضبط الدقيق والمحاذاة، بما في ذلك: - الضبط الدقيق الخاضع للإشراف (SFT) عبر `SFTTrainer` - تحسين السياسة النسبية للمجموعة (GRPO) عبر `GRPOTrainer` - تحسين التفضيلات المباشر (DPO) عبر `DPOTrainer` - تحسين كانيمان-تفرسكي (KTO) عبر `KTOTrainer` - تدريب نموذج المكافأة عبر `RewardTrainer` تتكامل المكتبة مع منظومة Hugging Face، حيث تستفيد من Accelerate للتوسع عبر مجموعات متعددة العقد (تدعم DDP و DeepSpeed و FSDP) ومن PEFT للتدريب الفعال باستخدام LoRA/QLoRA والكمية (quantization). كما تتكامل مع Unsloth للتسريع على مستوى النواة (kernel-level acceleration). يمكن للمستخدمين التفاعل مع TRL من خلال واجهة برمجة تطبيقات Python أو واجهة سطر الأوامر (CLI) للضبط الدقيق بدون كتابة أكواد. تتضمن المكتبة أيضاً أدلة للتدريب على تسلسلات سياقية طويلة (تتجاوز مليون توكن).