这个项目能做什么

PEFT (Parameter-Efficient Fine-Tuning) 通过仅微调模型参数的一个小子集而非整个网络,使大型预训练模型能够适应下游任务。这种方法显著降低了 GPU 显存需求和检查点的存储空间。 核心能力包括: - 实现了多种 PEFT 方法,如 LoRA、Soft prompts 和 IA3。 - 与 Hugging Face 生态系统集成,包括用于训练/推理的 Transformers、用于适配器管理的 Diffusers 以及用于分布式计算的 Accelerate。 - 支持量化(例如 QLoRA)以进一步减少内存占用,允许在消费级硬件上训练大型模型。 - 能够保存和加载轻量级适配器(通常仅几 MB),而无需保存完整的模型权重。 - 与用于 RLHF(基于人类反馈的强化学习)工作流的 TRL 兼容,包括直接偏好优化 (DPO)。