इस प्रोजेक्ट के बारे में

AirLLM consumer-grade GPUs पर 2 GB VRAM जैसी न्यूनतम मात्रा में भी बिलियन-पैरामीटर वाले भाषा मॉडल का inference और fine-tuning सक्षम बनाता है। यह किसी भी समय GPU पर केवल एक transformer layer रखकर काम करता है — weights डिस्क से layer-by-layer stream होते हैं, इसलिए GPU memory requirements कुल मॉडल साइज पर नहीं बल्कि layer size पर निर्भर करती हैं। मुख्य क्षमताएँ: - कम-अंत के single GPU पर ~8B से 2.8T parameters तक के मॉडल के लिए inference - अप टू 3× तेज़ inference के लिए वैकल्पिक block-wise quantization (4-bit या 8-bit) - छोटे VRAM पर huge मॉडल का LoRA fine-tuning; frozen base weights डिस्क से stream होती हैं जबकि adapters resident रहते हैं - MoE, Flash, FP8, और native vision (VL) architectures का समर्थन - cross-platform: Linux/CUDA और macOS (Apple Silicon via MLX) समर्थित मॉडल परिवारों में Llama (2/3/3.1/3.3/4), Qwen (1/2/2.5/3/3.5/3.8, dense और MoE), DeepSeek (V2/V3/R1), Mistral और Mixtral, Phi, Gemma, ChatGLM, Baichuan, InternLM, Yi, और Kimi K3 शामिल हैं। Usage उदाहरण: ```python from airllm import AutoModel model = AutoModel.from_pretrained("Qwen/Qwen3-32B") input_tokens = model.tokenizer(text, return_tensors="pt", truncation=True, max_length=128) generation_output = model.generate(input_tokens['input_ids'].cuda(), max_new_tokens=20) ``` वैकल्पिक compression के साथ: ```python model = AutoModel.from_pretrained("garage-bAInd/Platypus2-70B-instruct", compression='4bit') ``` Training उदाहरण (LoRA): ```bash python air_llm/examples/train_qwen38_flash_next_lora.py --data my_data.jsonl --seq-len 512 --save-adapter adapter.pt ``` Configuration options: compression (none/4bit/8bit), profiling_mode, layer_shards_saving_path, hf_token, prefetching (डिफ़ॉल्ट ऑन), delete_original। original model पहले रन पर layer-wise split और cached होता है, इसलिए Hugging Face cache directory में पर्याप्त disk space की आवश्यकता है।