Об этом проекте
TRL (Transformers Reinforcement Learning) — это библиотека, предназначенная для пост-обучения базовых моделей. Она предоставляет набор тренеров для реализации различных методов тонкой настройки и выравнивания, включая:
- Supervised Fine-Tuning (SFT) через `SFTTrainer`
- Group Relative Policy Optimization (GRPO) через `GRPOTrainer`
- Direct Preference Optimization (DPO) через `DPOTrainer`
- Kahneman-Tversky Optimization (KTO) через `KTOTrainer`
- Обучение моделей вознаграждения через `RewardTrainer`
Библиотека интегрирована с экосистемой Hugging Face, используя Accelerate для масштабирования на многоузловых кластерах (поддержка DDP, DeepSpeed и FSDP) и PEFT для эффективного обучения с помощью LoRA/QLoRA и квантования. Она также интегрируется с Unsloth для ускорения на уровне ядер.
Пользователи могут взаимодействовать с TRL через Python API или интерфейс командной строки (CLI) для тонкой настройки без написания кода. Библиотека также включает руководства по обучению на последовательностях с длинным контекстом (более 1 млн токенов).