इस प्रोजेक्ट के बारे में
TRL (Transformers Reinforcement Learning) एक लाइब्रेरी है जिसे फाउंडेशन मॉडल्स की पोस्ट-ट्रेनिंग के लिए डिज़ाइन किया गया है। यह विभिन्न फाइन-ट्यूनिंग और एलाइनमेंट तरीकों को लागू करने के लिए ट्रेनर्स का एक सूट प्रदान करता है, जिसमें शामिल हैं:
- `SFTTrainer` के माध्यम से Supervised Fine-Tuning (SFT)
- `GRPOTrainer` के माध्यम से Group Relative Policy Optimization (GRPO)
- `DPOTrainer` के माध्यम से Direct Preference Optimization (DPO)
- `KTOTrainer` के माध्यम से Kahneman-Tversky Optimization (KTO)
- `RewardTrainer` के माध्यम से Reward model training
यह लाइब्रेरी Hugging Face इकोसिस्टम के साथ एकीकृत है, जो मल्टी-नोड क्लस्टर्स (DDP, DeepSpeed और FSDP का समर्थन करते हुए) पर स्केलिंग के लिए Accelerate और LoRA/QLoRA और क्वांटाइजेशन का उपयोग करके कुशल प्रशिक्षण के लिए PEFT का लाभ उठाती है। यह कर्नल-लेवल एक्सेलेरेशन के लिए Unsloth के साथ भी एकीकृत है।
उपयोगकर्ता Python API या कोड-मुक्त फाइन-ट्यूनिंग के लिए कमांड लाइन इंटरफेस (CLI) के माध्यम से TRL के साथ इंटरैक्ट कर सकते हैं। लाइब्रेरी में लंबे कॉन्टेक्स्ट सीक्वेंस (1M टोकन से अधिक) पर ट्रेनिंग के लिए गाइड भी शामिल हैं।