这个项目能做什么

TRL (Transformers Reinforcement Learning) 是一个专为基础模型后训练设计的库。它提供了一套训练器来实现各种微调和对齐方法,包括: - 通过 `SFTTrainer` 进行的有监督微调 (SFT) - 通过 `GRPOTrainer` 进行的组相对策略优化 (GRPO) - 通过 `DPOTrainer` 进行的直接偏好优化 (DPO) - 通过 `KTOTrainer` 进行的 Kahneman-Tversky 优化 (KTO) - 通过 `RewardTrainer` 进行的奖励模型训练 该库与 Hugging Face 生态系统集成,利用 Accelerate 实现跨多节点集群的扩展(支持 DDP、DeepSpeed 和 FSDP),并利用 PEFT 通过 LoRA/QLoRA 和量化实现高效训练。它还与 Unsloth 集成以实现内核级加速。 用户可以通过 Python API 或命令行界面 (CLI) 与 TRL 交互,从而实现无需代码的微调。该库还包含了关于训练长上下文序列(超过 100 万个 token)的指南。