프로젝트 소개

TRL (Transformers Reinforcement Learning)은 파운데이션 모델의 사후 학습을 위해 설계된 라이브러리입니다. 다음과 같은 다양한 미세 조정 및 정렬 방법을 구현하기 위한 트레이너 세트를 제공합니다: - `SFTTrainer`를 통한 지도 미세 조정 (SFT) - `GRPOTrainer`를 통한 그룹 상대 정책 최적화 (GRPO) - `DPOTrainer`를 통한 직접 선호도 최적화 (DPO) - `KTOTrainer`를 통한 Kahneman-Tversky 최적화 (KTO) - `RewardTrainer`를 통한 보상 모델 학습 이 라이브러리는 Hugging Face 생태계와 통합되어 있으며, Accelerate를 활용해 멀티 노드 클러스터(DDP, DeepSpeed, FSDP 지원)에서 확장 가능하고, PEFT를 통해 LoRA/QLoRA 및 양자화를 이용한 효율적인 학습을 지원합니다. 또한 커널 수준의 가속화를 위해 Unsloth와도 통합되어 있습니다. 사용자는 Python API 또는 코드 없이 미세 조정을 수행할 수 있는 명령줄 인터페이스(CLI)를 통해 TRL과 상호작용할 수 있습니다. 또한 이 라이브러리는 100만 토큰 이상의 긴 컨텍스트 시퀀스 학습을 위한 가이드도 포함하고 있습니다.