このプロジェクトについて

TRL (Transformers Reinforcement Learning) は、基盤モデルの後学習向けに設計されたライブラリです。以下を含む、さまざまな微調整およびアライメント手法を実装するためのトレーナースイートを提供します: - `SFTTrainer` による教師あり微調整 (SFT) - `GRPOTrainer` による Group Relative Policy Optimization (GRPO) - `DPOTrainer` による Direct Preference Optimization (DPO) - `KTOTrainer` による Kahneman-Tversky Optimization (KTO) - `RewardTrainer` による報酬モデルのトレーニング このライブラリはHugging Faceエコシステムと統合されており、マルチノードクラスターでのスケーリング(DDP、DeepSpeed、FSDPをサポート)にはAccelerateを、LoRA/QLoRAや量子化を用いた効率的なトレーニングにはPEFTを活用しています。また、カーネルレベルの加速のためにUnslothとも統合されています。 ユーザーは、Python APIまたはコード不要の微調整が可能なコマンドラインインターフェース (CLI) を通じてTRLを利用できます。また、このライブラリには、長いコンテキストシーケンス(100万トークン超)でのトレーニングに関するガイドも含まれています。