इस प्रोजेक्ट के बारे में
AirLLM consumer-grade GPUs पर 2 GB VRAM जैसी न्यूनतम मात्रा में भी बिलियन-पैरामीटर वाले भाषा मॉडल का inference और fine-tuning सक्षम बनाता है। यह किसी भी समय GPU पर केवल एक transformer layer रखकर काम करता है — weights डिस्क से layer-by-layer stream होते हैं, इसलिए GPU memory requirements कुल मॉडल साइज पर नहीं बल्कि layer size पर निर्भर करती हैं।
मुख्य क्षमताएँ:
- कम-अंत के single GPU पर ~8B से 2.8T parameters तक के मॉडल के लिए inference
- अप टू 3× तेज़ inference के लिए वैकल्पिक block-wise quantization (4-bit या 8-bit)
- छोटे VRAM पर huge मॉडल का LoRA fine-tuning; frozen base weights डिस्क से stream होती हैं जबकि adapters resident रहते हैं
- MoE, Flash, FP8, और native vision (VL) architectures का समर्थन
- cross-platform: Linux/CUDA और macOS (Apple Silicon via MLX)
समर्थित मॉडल परिवारों में Llama (2/3/3.1/3.3/4), Qwen (1/2/2.5/3/3.5/3.8, dense और MoE), DeepSeek (V2/V3/R1), Mistral और Mixtral, Phi, Gemma, ChatGLM, Baichuan, InternLM, Yi, और Kimi K3 शामिल हैं।
Usage उदाहरण:
```python
from airllm import AutoModel
model = AutoModel.from_pretrained("Qwen/Qwen3-32B")
input_tokens = model.tokenizer(text, return_tensors="pt", truncation=True, max_length=128)
generation_output = model.generate(input_tokens['input_ids'].cuda(), max_new_tokens=20)
```
वैकल्पिक compression के साथ:
```python
model = AutoModel.from_pretrained("garage-bAInd/Platypus2-70B-instruct", compression='4bit')
```
Training उदाहरण (LoRA):
```bash
python air_llm/examples/train_qwen38_flash_next_lora.py --data my_data.jsonl --seq-len 512 --save-adapter adapter.pt
```
Configuration options: compression (none/4bit/8bit), profiling_mode, layer_shards_saving_path, hf_token, prefetching (डिफ़ॉल्ट ऑन), delete_original। original model पहले रन पर layer-wise split और cached होता है, इसलिए Hugging Face cache directory में पर्याप्त disk space की आवश्यकता है।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.