Sobre o projeto
O LlamaFactory é um framework de código aberto para ajuste fino de grandes modelos de linguagem (LLMs) e modelos multimodais. O README destaca suporte a muitas famílias de modelos, incluindo LLaMA/LLaVA, Mistral, Mixtral, Qwen3/Qwen2.5-VL, DeepSeek, Gemma, GLM, Phi, GPT-OSS, InternVL e outros. Ele integra uma ampla variedade de métodos de treinamento: pré-treinamento continuado, ajuste fino supervisionado, modelagem de recompensa e abordagens de preferência ou aprendizado por reforço, como PPO, DPO, KTO, ORPO e SimPO. Também suporta ajuste de parâmetros completos, congelamento, LoRA e QLoRA quantizado, incluindo quantização de 2/3/4/5/6/8 bits via AQLM, AWQ, GPTQ, LLM.int8, HQQ e EETQ. O projeto inclui otimizadores avançados e truques de desempenho: GaLore, BAdam, APOLLO, Adam-mini, Muon, OFT, DoRA, LongLoRA, PiSSA, FlashAttention-2, Unsloth, Liger Kernel, RoPE scaling, NEFTune e rsLoRA. Entradas recentes do changelog também mencionam um backend de treinamento Megatron-core, suporte a inferência SGLang e suporte a ajuste fino para os modelos GPT-OSS, Qwen2.5 Omni, GLM-4.1V-Thinking e Intern-S1-mini.
O LlamaFactory oferece uso sem código por meio de uma interface de linha de comando e da LLaMA Board Web UI construída com Gradio, além de um notebook Colab e modelos de implantação em nuvem para plataformas como PAI-DSW e Hugging Face Spaces. Checkpoints ajustados podem ser exportados e servidos por meio de uma API compatível com OpenAI, uma interface Gradio ou uma CLI, com vLLM ou SGLang disponíveis como backends de inferência mais rápidos. O rastreamento de experimentos é suportado com TensorBoard, WandB, MLflow, SwanLab e LlamaBoard. Modelos e conjuntos de dados podem ser baixados do Hugging Face, ModelScope e Modelers Hub. O README também cita uso por Amazon, NVIDIA e Aliyun, e links para documentação, imagens Docker, notebooks de exemplo e o blog oficial do projeto.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.