Sobre o projeto

TRL (Transformers Reinforcement Learning) é uma biblioteca projetada para o pós-treinamento de modelos de fundação. Ela fornece um conjunto de treinadores para implementar vários métodos de ajuste fino e alinhamento, incluindo: - Supervised Fine-Tuning (SFT) via `SFTTrainer` - Group Relative Policy Optimization (GRPO) via `GRPOTrainer` - Direct Preference Optimization (DPO) via `DPOTrainer` - Kahneman-Tversky Optimization (KTO) via `KTOTrainer` - Treinamento de modelo de recompensa via `RewardTrainer` A biblioteca é integrada ao ecossistema Hugging Face, aproveitando o Accelerate para escalonamento em clusters de múltiplos nós (suportando DDP, DeepSpeed e FSDP) e o PEFT para treinamento eficiente usando LoRA/QLoRA e quantização. Ela também se integra ao Unsloth para aceleração em nível de kernel. Os usuários podem interagir com o TRL por meio de uma API Python ou de uma Interface de Linha de Comando (CLI) para ajuste fino sem código. A biblioteca também inclui guias para treinamento em sequências de contexto longo (além de 1M de tokens).