Sobre o projeto
TRL (Transformers Reinforcement Learning) é uma biblioteca projetada para o pós-treinamento de modelos de fundação. Ela fornece um conjunto de treinadores para implementar vários métodos de ajuste fino e alinhamento, incluindo:
- Supervised Fine-Tuning (SFT) via `SFTTrainer`
- Group Relative Policy Optimization (GRPO) via `GRPOTrainer`
- Direct Preference Optimization (DPO) via `DPOTrainer`
- Kahneman-Tversky Optimization (KTO) via `KTOTrainer`
- Treinamento de modelo de recompensa via `RewardTrainer`
A biblioteca é integrada ao ecossistema Hugging Face, aproveitando o Accelerate para escalonamento em clusters de múltiplos nós (suportando DDP, DeepSpeed e FSDP) e o PEFT para treinamento eficiente usando LoRA/QLoRA e quantização. Ela também se integra ao Unsloth para aceleração em nível de kernel.
Os usuários podem interagir com o TRL por meio de uma API Python ou de uma Interface de Linha de Comando (CLI) para ajuste fino sem código. A biblioteca também inclui guias para treinamento em sequências de contexto longo (além de 1M de tokens).