À propos du projet
TRL (Transformers Reinforcement Learning) est une bibliothèque conçue pour le post-entraînement de modèles de fondation. Elle fournit un ensemble d'entraîneurs pour implémenter diverses méthodes de réglage fin et d'alignement, notamment :
- Le Supervised Fine-Tuning (SFT) via `SFTTrainer`
- Le Group Relative Policy Optimization (GRPO) via `GRPOTrainer`
- Le Direct Preference Optimization (DPO) via `DPOTrainer`
- Le Kahneman-Tversky Optimization (KTO) via `KTOTrainer`
- L'entraînement de modèles de récompense via `RewardTrainer`
La bibliothèque est intégrée à l'écosystème Hugging Face, s'appuyant sur Accelerate pour la mise à l'échelle sur des clusters multi-nœuds (supportant DDP, DeepSpeed et FSDP) et sur PEFT pour un entraînement efficace utilisant LoRA/QLoRA et la quantification. Elle s'intègre également avec Unsloth pour l'accélération au niveau du noyau.
Les utilisateurs peuvent interagir avec TRL via une API Python ou une interface en ligne de commande (CLI) pour un réglage fin sans code. La bibliothèque comprend également des guides pour l'entraînement sur des séquences de contexte long (au-delà de 1M de tokens).