Об этом проекте

TRL (Transformers Reinforcement Learning) — это библиотека, предназначенная для пост-обучения базовых моделей. Она предоставляет набор тренеров для реализации различных методов тонкой настройки и выравнивания, включая: - Supervised Fine-Tuning (SFT) через `SFTTrainer` - Group Relative Policy Optimization (GRPO) через `GRPOTrainer` - Direct Preference Optimization (DPO) через `DPOTrainer` - Kahneman-Tversky Optimization (KTO) через `KTOTrainer` - Обучение моделей вознаграждения через `RewardTrainer` Библиотека интегрирована с экосистемой Hugging Face, используя Accelerate для масштабирования на многоузловых кластерах (поддержка DDP, DeepSpeed и FSDP) и PEFT для эффективного обучения с помощью LoRA/QLoRA и квантования. Она также интегрируется с Unsloth для ускорения на уровне ядер. Пользователи могут взаимодействовать с TRL через Python API или интерфейс командной строки (CLI) для тонкой настройки без написания кода. Библиотека также включает руководства по обучению на последовательностях с длинным контекстом (более 1 млн токенов).