Sobre el proyecto

TRL (Transformers Reinforcement Learning) es una biblioteca diseñada para el post-entrenamiento de modelos fundacionales. Proporciona un conjunto de entrenadores para implementar varios métodos de ajuste fino y alineación, incluyendo: - Supervised Fine-Tuning (SFT) a través de `SFTTrainer` - Group Relative Policy Optimization (GRPO) a través de `GRPOTrainer` - Direct Preference Optimization (DPO) a través de `DPOTrainer` - Kahneman-Tversky Optimization (KTO) a través de `KTOTrainer` - Entrenamiento de modelos de recompensa a través de `RewardTrainer` La biblioteca está integrada con el ecosistema de Hugging Face, aprovechando Accelerate para el escalado en clústeres de múltiples nodos (con soporte para DDP, DeepSpeed y FSDP) y PEFT para un entrenamiento eficiente mediante LoRA/QLoRA y cuantización. También se integra con Unsloth para la aceleración a nivel de kernel. Los usuarios pueden interactuar con TRL a través de una API de Python o una Interfaz de Línea de Comandos (CLI) para el ajuste fino sin código. La biblioteca también incluye guías para el entrenamiento en secuencias de contexto largo (más de 1M de tokens).