Sobre o projeto
O AirLLM possibilita inferência e ajuste fino de modelos de linguagem com bilhões de parâmetros em GPUs de nível consumidor, com apenas 2 GB de VRAM. Ele funciona mantendo apenas uma única camada de transformer na GPU por vez — os pesos são transmitidos do disco camada por camada — portanto, os requisitos de memória da GPU dependem do tamanho da camada, não do tamanho total do modelo.
Principais recursos:
- Inferência para modelos variando de ~8B a 2.8T parâmetros em uma única GPU de baixo custo
- Quantização opcional por bloco (4 bits ou 8 bits) para inferência até 3× mais rápida
- Ajuste fino LoRA de modelos enormes em VRAM pequena; pesos base congelados transmitidos do disco enquanto adaptadores permanecem residentes
- Suporte a arquiteturas MoE, Flash, FP8 e visão nativa (VL)
- Multiplataforma: Linux/CUDA e macOS (Apple Silicon via MLX)
As famílias de modelos suportadas incluem Llama (2/3/3.1/3.3/4), Qwen (1/2/2.5/3/3.5/3.8, denso e MoE), DeepSeek (V2/V3/R1), Mistral & Mixtral, Phi, Gemma, ChatGLM, Baichuan, InternLM, Yi e Kimi K3.
Exemplo de uso:
```python
from airllm import AutoModel
model = AutoModel.from_pretrained("Qwen/Qwen3-32B")
input_tokens = model.tokenizer(text, return_tensors="pt", truncation=True, max_length=128)
generation_output = model.generate(input_tokens['input_ids'].cuda(), max_new_tokens=20)
```
Com compressão opcional:
```python
model = AutoModel.from_pretrained("garage-bAInd/Platypus2-70B-instruct", compression='4bit')
```
Exemplo de treinamento (LoRA):
```bash
python air_llm/examples/train_qwen38_flash_next_lora.py --data my_data.jsonl --seq-len 512 --save-adapter adapter.pt
```
Opções de configuração: compression (none/4bit/8bit), profiling_mode, layer_shards_saving_path, hf_token, prefetching (padrão ativado), delete_original. O modelo original é dividido e armazenado em cache camada a camada na primeira execução, portanto, é necessário espaço em disco suficiente no diretório de cache do Hugging Face.
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.