このプロジェクトについて
TRL (Transformers Reinforcement Learning) は、基盤モデルの後学習向けに設計されたライブラリです。以下を含む、さまざまな微調整およびアライメント手法を実装するためのトレーナースイートを提供します:
- `SFTTrainer` による教師あり微調整 (SFT)
- `GRPOTrainer` による Group Relative Policy Optimization (GRPO)
- `DPOTrainer` による Direct Preference Optimization (DPO)
- `KTOTrainer` による Kahneman-Tversky Optimization (KTO)
- `RewardTrainer` による報酬モデルのトレーニング
このライブラリはHugging Faceエコシステムと統合されており、マルチノードクラスターでのスケーリング(DDP、DeepSpeed、FSDPをサポート)にはAccelerateを、LoRA/QLoRAや量子化を用いた効率的なトレーニングにはPEFTを活用しています。また、カーネルレベルの加速のためにUnslothとも統合されています。
ユーザーは、Python APIまたはコード不要の微調整が可能なコマンドラインインターフェース (CLI) を通じてTRLを利用できます。また、このライブラリには、長いコンテキストシーケンス(100万トークン超)でのトレーニングに関するガイドも含まれています。